把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
5747点击    2026-08-18 15:10

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?


Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。


VLM大模型(VLM)在静态视觉与推理任务上已展现出强悍能力。然而在具身智能领域,当模型需要面对复杂的动态交互与机械臂控制时,它们能否准确评估智能体的动作与画面变化,依然是一个待检验的问题。


过去不少人以为,能“看懂画面”就意味着能“当好教练”。但对具身智能来说,从识别场景到精准评估动作进展,完全是两码事。


为了厘清各大模型在真实动作评估中的底细,国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,把 Gemini 2.0、GPT-4.1 等主流大模型拉进同一个考场,对它们的视觉裁决能力做了一场综合评估。


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

论文链接:https://arxiv.org/pdf/2607.00483


01

考场设计:四大仿真套件、

10 大场景与“看图判进展”规则


研究团队选用的 10 个典型任务,涵盖了具身智能的四大主流仿真套件。


其中既有 Cart Pole(倒立摆平衡)这类考察基础刚体平衡控制的任务;也包含了 Straighten Rope(拉直绳索)与 Pass Water(平移水杯),这类专门考察模型对非刚体形变与连续流体微观感知能力的柔体操作。


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

研究所选用的 10 大典型具身智能任务场景


此外,任务库还涵盖了 Soccer(踢球入网)、Sweep Into(扫方块入洞)和 Open Drawer(拉开抽屉),这类任务考察的是模型对三维空间中机械臂末端与物理接触关系的精准理解;


以及《我的世界》中的 Combat Spider(击杀蜘蛛)、Milk Cow(挤牛奶)、Shear Sheep(剪羊毛)和 Hunt Cow(追逐猎牛),这类任务考察的则是模型在复杂视角下,进行长时程、多步骤逻辑规划的综合能力。


在这场测试中,研究团队剥离了游戏或物理引擎内部的“上帝视角数据”(比如物体的精确三维坐标、速度等)。大模型只能像人类玩家一样,接收第一人称 RGB 视觉画面以及一句简单的自然语言任务目标。


从智能体的探索轨迹中随机采样出前后两个时刻的观察画面,连同任务文本提示词一同喂给冻结参数的VLM。大模型需要做出判断:画面 1 和画面 2 相比,哪一个画面代表智能体离任务目标更近?


为了保证评测的客观性,研究团队为每个任务都精心准备了 100 对包含伪真值的对照画面组,用来直接衡量各大 VLM 在具身场景下的偏好判断准确率。


比赛规则已经明确,接下来就是各大主流 VLM 登场硬碰硬的时刻了。


02

横向实测:Gemini 综合最稳,

开源小模型局部反超


当这批十项具身考核任务布置下去后,各大VLM表现出来的差异之大,远超预期。


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

各大主流VLM在 10 项具身任务中的进展预测准确率


综合领跑:Gemini-2.0-Flash 准确率全线突破 70%


在这场具身感知大打擂中,Gemini-2.0-Flash 展现出了极佳的综合泛化能力。  虽然在个别任务上被开源小模型拿走了最高分,但 Gemini 是唯一一个在所有 10 项任务中准确率全部保持在 70% 以上的模型。


它在 Cart Pole 任务上达到了 91%,在 MetaWorld 的机械臂任务中也稳定在 84%~87%。这种全场景无短板的推理稳定性,让它能敏锐察觉到“水杯有没有倾斜过头”、“机械臂末端是否钩住抽屉”等微观物理变化。


局限明显:GPT-4.1 表现平平,传统 CLIP 彻底失灵


相比之下,另外几位“明星选手”的表现则令人有些意外。


GPT-4.1-nano在大多数具身任务中准确率仅在 60%~66% 徘徊,对于稍微复杂一点的空间时序变化(如踢足球入网 Soccer 仅 60%)判断力明显不足。


CLIP / MineCLIP等传统靠向量余弦相似度打分的对比学习模型彻底陷入低迷。即便是专门在《我的世界》海量视频上做过微调的 MineCLIP,在 MineDojo 任务中的准确率也仅在 39%~59% 之间。


这印证了一个行业共识:缺乏高阶VLM推理能力的特征匹配模型,很难看懂连续动作中的微观物理进展。


局部反超:Phi-3.5 与 DeepSeek 在特定任务爆发


更有趣的是,几款开源轻量模型虽然综合能力不如商业大模型,但在特定场景下却爆发出了惊人的“专业对口”天赋 。


  • Phi-3.5-Vision-Instruct(4.15B 参数) 虽然在基础控制任务上表现平平,但在《我的世界》的“挤牛奶”和“剪羊毛”任务中,打出了惊人的 90% 准确率,表现甚至反超了 Gemini!
  • DeepSeek-VL2-Tiny(3.37B 参数) 在小模型普遍吃力的“打蜘蛛”高动态战斗场景中,拿下了 85% 的高分。
  • MiniCPM-o-2.6(8.67B 参数): 在极难捕捉液体状态的“倒水”任务中,做出了 73% 的精准裁决。


无论是全能的 Gemini 2.0,还是在特定场景爆发的开源小模型,都证明了VLM大模型完全具备作为高水平“具身视觉裁判”的能力。但另一个问题随之而来:既然教练这么聪明,我们真的能直接请它来“全程执教”吗?


03

高频调用成本难承受,

且单图绝对打分易失灵


既然打擂结果表明 Gemini 2.0 等大模型具备出色的具身判断力,那么直接让大模型全程坐镇、实时给强化学习(RL)智能体打分不就行了吗?


然而,研究团队在实际落地的过程中,很快撞上了两座难以逾越的大山。


成本与延迟:高频请求 API 带来天价账单与延迟


强化学习的策略优化通常需要经历数十万甚至上百万步的环境交互。 如果智能体每走一步(甚至每隔几步),都将当前画面打包上传到云端 API 请求一次 Gemini 或 GPT-4.1,后果将是灾难性的:


  • 天价账单: 几十万次高频次的VLM API 调用,单次训练成本就会飙升至数万美元。
  • 延迟崩溃: 网络请求与大模型推理的延迟,会让本就耗时的 RL 训练速度降低数十倍,在工程上几乎不可接受。


算法缺陷:绝对打分导致评分漂移与循环任务失效


退一步讲,即便忽略 API 成本,仅依靠 VLM 对单个状态进行绝对打分这种传统思路(如以往的 SOTA 方法 RL-VLM-F),在算法逻辑上也存在着致命缺陷。


  • 奖励评估剧烈漂移


在 RL 训练初期,智能体能看到的画面非常有限。随着训练推进,智能体不断探索出全新的场景,绝对打分模型的评分基准会随之发生剧烈漂移。


在同一个《我的世界》“挤牛奶”专家轨迹上,绝对奖励在训练到 512k 步和 942k 步时给出的得分曲线剧烈波动、极不一致。这种时高时低的奖惩信号,会直接把智能体“搞晕”。


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?


  • 循环逻辑彻底失效


具身任务中充斥着大量非线性或循环动作,例如机械臂来回微调、按固定路线巡逻、绕圈找牛等。


研究团队用了一个非常经典的环形跑道来揭示这个问题:


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

在 Ringworld 环形任务中,传统的绝对打分会导致智能体陷入死循环(收益为 0)


在环形跑道中,智能体需要沿着圆环顺时针不断移动。  由于圆环上的状态不存在全局固定的“先后顺序”,试图给每一个位置打出固定的全局高低分在数学上是根本不成立的。  采用绝对奖励训练的智能体收益始终为 0,完全无法学会这种周期性任务。


一边是昂贵的调用开销,一边是单图打分容易引发的死循环与评估漂移。  为了让大模型真正成为合格且便宜的具身教官,清华与 NVIDIA 团队交出了一套极为巧妙的破局方案。


04

架构解法:

双奖励结合孪生网络蒸馏,

查询开销降至1/20


面对“请不起云端大模型”和“单图绝对打分易失效”的双重瓶颈,清华与 NVIDIA 团队提出了名为 VLM-AR3L 的全新框架。


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

VLM-AR3L 框架:大模型在后台离线打标,本地轻量孪生网络在前台指导


这套解法的精妙之处在于两点:打分逻辑上的“双奖励融合”,以及工程落地上的“大模型轻量蒸馏”


绝对+相对双奖励:兼顾全局方向与微观步骤推进


既然只看单张图的“绝对打分”容易引发分数漂移和循环路况失灵,那就引入“相对对比”!


  • 绝对奖励(Absolute Reward,看全局): 评估单个状态离目标的远近,为智能体提供全局的方向感。
  • 相对奖励(Relative Reward,看增量微操): 比较当前观察s_t与过去某一步观察sₜ₋ₖ(引入时间偏移 $$k=1$$)之间的变化,判断智能体这一步到底是进步还是退步了。


为了防止大模型产生幻觉或盲目预测,团队还设置了一套双向对称置信度检验规则:只有当相对模型同时高度确信“当前状态优于过去状态”且“过去状态不如当前状态”时,才会发放正向奖励。


最后,将两者归一化后按照比例结合,既保留了全局大方向,又锚定了微观步骤的真实推进。


离线打标与孪生网络:把大模型 API 查询频次打下 20 倍


为了把高昂的 API 账单打下来,研究团队并没有在 RL 探索时直接去频繁查询大模型。


如图所示,他们巧妙地将过程拆分为两条线:


1.后台异步打标: 大模型只负责在后台定期从经验回放池(Replay Buffer)中离线采样图像对,并生成偏好标签。


2.本地轻量替代: 团队使用这些离线标签,训练了一个极小的孪生网络。在前台 RL 策略训练时,智能体直接调用本地这个轻量网络获取奖励。


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?


这项工程优化直接将 VLM 的查询需求降低了 约 20 倍,原本需要数万美元的训练成本和高延迟问题迎刃而解。


05

实战效果:攻克长时程探索死局,

表现超越人类手写奖励


这套“双奖励+孪生网络蒸馏”的组合拳在真实具身任务中的战力如何?论文给出了非常具有说服力的答案。


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

VLM-AR3L 与各类基线方法的最终任务成功率


在面对《我的世界》等复杂的具身场景时,以往依靠绝对打分的 RL-VLM-F 方法表现大幅下滑(如在 Shear Sheep 中成功率仅 0.47);而 VLM-AR3L 在 Combat Spider(打蜘蛛,85%)、Milk Cow(挤牛奶,95%)等任务上均实现了高成功率收敛。


把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

VLM-AR3L训练曲线


更令人惊喜的是,在像挤牛奶、剪羊毛、猎牛这类极度依赖长时程探索的任务中,即便是人类工程师精心手写的稀疏真值奖励,智能体也因为反馈过于稀疏而完全无法学会(成功率为 0)。


而 VLM-AR3L 凭借密集且稳定的相对进展信号,成功引导智能体学会了完整的长时程交互流程,表现甚至打败了人类手写的真值奖励!


06

具身智能时代的分工:

大模型当总教官,小模型做动作执行


这篇论文的意义不仅在于提出了一个高效的算法框架,更在于它为大模型与具身智能的结合提供了一种极其清晰的思路。


在未来的具身智能范式中,通用VLM或许不需要亲自操盘底层的每一个电机转动或关节控制,也不需要在每个毫秒级的控制循环中实时响应。


大模型的真正价值,在于扮演一个高屋建瓴的总教官。它凭借对世界的深刻认知与常识,去评判进展、离线打标,并将这种感知能力蒸馏给轻量化、端到端的策略小模型。这或许正是具身智能迈向高可靠、低成本落地的钥匙。


文章来自于"AI科技评论",作者 "张璐"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

4
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

5
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0