具身智能最缺的“空间常识”,被这套隐空间强化学习一次性补全 | ECCV‘26
具身智能最缺的“空间常识”,被这套隐空间强化学习一次性补全 | ECCV‘26大规模视频扩散模型,画面越来越真,却总在“物理定律”上栽跟头。
来自主题: AI技术研报
5072 点击 2026-07-29 13:49
搜索
大规模视频扩散模型,画面越来越真,却总在“物理定律”上栽跟头。
最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。