WAIC信息爆炸!大佬们都在说什么,笔记看这里
WAIC信息爆炸!大佬们都在说什么,笔记看这里WAIC(世界人工智能大会)第一天,信息量已经爆炸。从AI时代国家和企业的核心竞争力,到大模型迈向物理世界、迈向AGI所面临的挑战,再到Coding之后新的AI产品趋势……围绕从技术到产业的方方面面,图灵奖得主、两院院士、AI TOP研究者和企业、企业家们共聚一堂,精彩发声不断:
搜索
WAIC(世界人工智能大会)第一天,信息量已经爆炸。从AI时代国家和企业的核心竞争力,到大模型迈向物理世界、迈向AGI所面临的挑战,再到Coding之后新的AI产品趋势……围绕从技术到产业的方方面面,图灵奖得主、两院院士、AI TOP研究者和企业、企业家们共聚一堂,精彩发声不断:
WAIC 前夕,星尘智能(Astribot)新模型 Lumo-2,直接在官网甩出 20 + 真机视频 ——这背后,是星尘智能发布的第二代具身基座模型,也是业内首个面向家庭场景的隐式世界 - 动作模型(Latent World-Action Model),同步发的,还智能体 Agent Philia。
RoboScience机器科学直接把世博馆展台,变成了 Visics 的压力测试场。换本体、换物品、换任务,多轮挑战轮番上阵,专挑具身大模型最容易掉链子的地方下手。Visics 的泛化能力究竟行不行?现场观众可以直接点题,围观验货。
阿里巴巴达摩院的最新工作RynnWorld-Teleop对此给出的方案是:用生成式世界模型替代真实机器人。操作员的手势驱动一个实时视频生成器,由“数字世界中的机器人”完成全部视觉演示,同时自动获得关节级的动作标签。该方案被称为数字遥操作(Digital Teleoperation)。
最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。
最近,一篇名为 FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining 的工作引起了不少关注。换句话说,FreeStyle 研究的是 style-content dual-reference generation,也就是「内容 - 风格双参考生成」。
曾推出 RoboTwin 系列基准的团队发布了 RoboDojo,一套统一覆盖仿真与真实机器人操作的具身智能评测体系。它包含 42 个仿真任务、18 个真实机器人任务,并将 30 个代表性机器人策略放到同一套标准下比较。
世界模型圈一大难题是定义模糊,起码三四个流派各研究各的,都做了个产品就说自己是真正的世界模型,谁也没法说谁的不是。蚂蚁旗下的灵波科技疑似把这问题给解决了,因为哥们直接把几乎现有所有方向都做了一遍。
大家好,我是袋鼠帝。 前几天,火山的朋友提前跟我同步了一个消息,说豆包Seed模型又更新了。
这场越来越快、越来越贵、越来越拥挤的竞赛里,我们还能做什么?