AI资讯新闻榜单内容搜索-Image

VeRL-Omni：面向扩散和全模态生成模型的通用RL后训练框架

VeRL-Omni 是一个面向多模态生成模型的通用 RL 后训练框架，由 VeRL-Omni 团队在 verl 与 vllm-omni 之上构建。覆盖扩散 transformer（Qwen-Image）、混合 AR-DiT（Qwen-Omni）、统一理解 + 生成（BAGEL、HunyuanImage-3.0）等架构。

来自主题: AI技术研报

7804 点击 2026-05-26 10:26

智象未来超两千亿参数图像大模型HiDream-O1-Image-Pro发布，融资持续提速

智象未来正式发布基于新一代原生全模态模型架构 Unified Transformer（UiT）打造的图像大模型 HiDream-O1-Image-Pro。这一超2千亿参数的原生全模态图像大模型，不仅在多个基准测试中刷新 SOTA 纪录，也标志着智象未来正向图像、视频、文本、音频等多模态统一建模的“原生全模态”阶段迈进。

来自主题: AI资讯

8964 点击 2026-05-25 09:49

22.9倍加速！FlashAR：仅用0.05%数据，让预训练好的自回归图像模型飞起来

来自浙江大学和阿德莱德大学的研究团队提出了 FlashAR—— 一个轻量级的后训练加速框架。不需要从头训练，在 Emu3.5-Image-34B 模型上，仅用原始训练数据的 0.05%（约 8 万张图片），就能将预训练好的自回归模型改造成高度并行的生成器 Emu3.5-34B-Flash，实现最高 22.9 倍的端到端加速。

来自主题: AI技术研报

8701 点击 2026-05-24 10:07

李飞飞最新发布ESI-Bench，空间智能的ImageNet来了

李飞飞团队最新发布ESI-Bench——一个专门用来评测具身空间智能的新基准。过去的空间智能评测默认给模型最优观测，而ESI-Bench第一个把观察者变成行动者，闭合了感知-行动回路。

来自主题: AI技术研报

9408 点击 2026-05-22 15:32

Sam Altman 官宣：ChatGPT Images 2.0 印度狂飙，27 天生成超 10 亿张图！AI 生图正在变成「视觉输入法」

Sam Altman 今天在 X 上扔出一个数字：ChatGPT Images 2.0 在印度已经生成超过 10 亿张图。距离产品发布只有 27 天。TechCrunch 和第三方数据验证了印度确实是最大市场——但全球增长远没有那么均匀，这更像一场区域性起飞。

来自主题: AI资讯

10227 点击 2026-05-19 14:58

Image 2 × Seedance 2.0王炸组合：4套刷屏外网的玩法，提示词全在这了

当「地表最强生图」遇上「最强视频生成」，这对王炸组合再一次点燃了网友们的创作激情。

来自主题: AI技术研报

10588 点击 2026-05-18 10:25

最早做文生视频的人，开始构建世界

走进智象未来合肥的办公室，首先映入眼帘的是一面员工照片墙。所有头像，都是AIGC生成的动漫风格。这家公司的核心业务是图像和视频生成——AI时代的自己，是他们在智象未来的第一课。

来自主题: AI资讯

9652 点击 2026-05-17 15:08

D-OPSD: 将OPSD引入扩散模型，让少步扩散模型「边跑边学」，还能学会新概念

阿里巴巴 Z-Image 团队联合香港科技大学、加州大学圣地亚哥分校、香港中文大学等机构提出 D-OPSD（On-Policy Self-Distillation），首个针对少步扩散模型的在线策略自蒸馏框架。D-OPSD 无需奖励模型、无需成对偏好数据，

来自主题: AI技术研报

8823 点击 2026-05-16 10:44

告别云端依赖！字节开源新作DreamLite让手机秒变 AI 画板

近日，字节跳动智能创作部门（Intelligent Creation Lab）提出新作 DreamLite，一个主干网络仅有 0.39B 参数的轻量级统一扩散模型，在单一网络内同时支持文生图（Text-to-Image）和图像编辑（Text-guided Image Editing）两个任务，是目前已知首个实现这一能力的端侧模型。

来自主题: AI技术研报

8956 点击 2026-05-13 10:30

Luma Uni-1.1 API开放，图像模型榜单第三，文字渲染直逼GPT image 2

今年以来，图像生成模型的迭代节奏明显加快。

来自主题: AI技术研报

10287 点击 2026-05-06 15:17