北大与微软亚研提出 BCP,让模型自己决定何时重规划

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
北大与微软亚研提出 BCP,让模型自己决定何时重规划
5582点击    2026-08-20 14:22

在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。北京大学与微软亚洲研究院的一项新工作指出:这个默认设定本身就是一个重要的失败原因 —— 它让重规划变成了与任务进度无关的周期性调度,当没有任何一次重规划恰好落在关键操作阶段之前时,机器人只能带着一个已经过时的 chunk 进入关键操作环节。


研究团队提出了 Bernoulli-Continuation Policy(BCP): 冻结基座 VLA,仅训练一个 16.4M 参数的轻量级 head,把「执行多久」分解为一系列「继续执行还是重新规划」的伯努利决策,并通过 GRPO 从轨迹级结果中进行优化。在 RoboTwin 2.0 全部 50 个任务上,LingBot-VLA 的平均成功率从 89.88% 提升至 93.94%,在 VLA 方法中取得 SOTA;真机挂马克杯任务的成功率则从从 44% 提升至 84%。


北大与微软亚研提出 BCP,让模型自己决定何时重规划


  • 论文标题:Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution
  • arXiv:2608.03483
  • 项目主页:https://fleetfootwork.github.io/BCP/


一、研究背景:被当成工程细节的决策维度


Action chunking 让 VLA 一次预测未来一段动作序列,而不是逐步预测单个动作,既降低了模型推理的频率,也改善了动作的时序一致性。在 chunk-based VLA 中有两个 horizon:prediction horizon 决定模型一次生成多少步动作,execution horizon 则决定这些动作中有多少步会被真正执行,执行完机器人再重新观测并规划。


OpenVLA、π_0.5、LingBot-VLA 等主流工作都采用固定的 execution horizon。这在自由空间中的粗粒度运动阶段问题不大——长序列往往更加平滑、稳定;但到了接触、对齐、夹爪闭合这类对精度敏感的阶段,微小的位姿误差就可能迅速累积,机器人必须在进入这些阶段之前重新观测。而固定的重规划节奏无法保证这一点。


为了量化这一现象,研究团队设计了一个 phase-shift 实验:所有变体都使用完全相同的 50 步 horizon,唯一的区别在于第一个 chunk 只执行 φ 步就重新规划,此后仍然每 50 步规划一次。换句话说,模型和 horizon 都完全相同,只有重规划边界的落点不同。RoboTwin 2.0 的 50 个任务上的结果如下所示:


北大与微软亚研提出 BCP,让模型自己决定何时重规划


最高和最低之间相差 11.3 个百分点,需要注意的是,这里 Upper / Lower Bound 都是 hindsight oracle,在真实部署时不可能提前知道。但这个结果说明了一件很关键的事:replanning timing 本身就是一个很强的决策变量


在 Placing Dual Shoes 任务上,这种差异表现得非常直观:当 φ=32 时,机器人执行了一个已经过时的夹爪闭合动作,最终导致任务失败;而当 φ=23 时,恰好有一次重规划落在关键操作阶段之前,机器人获得了新得观测,因此能够准确完成抓取动作并成功执行任务。同一任务上,最佳相位的成功率为 92%,而最差相位只有 80%。


北大与微软亚研提出 BCP,让模型自己决定何时重规划

图 1 同一模型、同一 50 步 horizon,仅改变重规划边界的落点:φ=32 时夹爪闭合幅度过时导致失败,φ=23 时边界恰落在操作阶段前而成功。成功率随相位在 0.80–0.92 间剧烈波动。


更重要的是,最优相位不存在可复用的规律。论文统计了 50 个任务各自的最佳 φ,并做卡方拟合优度检验:χ² = 5.00,p = 0.287,无法拒绝均匀分布的原假设。关键时刻在不同任务、不同阶段出现在不同时间,因此不存在一个固定相位能对齐所有精度敏感阶段。


由此论文提出了核心问题:给定一个已预测的 action chunk,机器人应该执行多久再停下来重规划?


二、方法:三个挑战与三个设计


学习这样一个策略并不容易,论文明确列出三个挑战,并逐条给出对应设计。


北大与微软亚研提出 BCP,让模型自己决定何时重规划

图 2 BCP 框架。冻结的 VLA 预测定长 action chunk,Bernoulli-Continuation Head 复用其表征输出一串「继续概率」,据此选定执行 horizon;整体用 GRPO + Replanning-Efficiency Reward 优化。


2.1 候选 horizon 具有前缀共享结构


执行 40 步与执行 50 步时,前 40 个动作完全相同,两者的区别只在于第 40 步之后是否继续执行。标准 softmax 分类器却会把不同候选 horizon 看成彼此独立、无序的类别,从而完全忽略这种天然的前缀共享结构。


Bernoulli-Continuation Head 的做法是:输出 M−1 个 logit,经 sigmoid 得到「继续概率」


北大与微软亚研提出 BCP,让模型自己决定何时重规划


这种因子分解与 chunk 执行天然具有的嵌套结构高度一致:只有当前 chunk 被连续判断为可信,策略才会逐步走向更长的 horizon;与此同时,相邻 horizon 也天然具有更接近的概率——这正是传统分类策略所缺失的序数归纳偏置。


北大与微软亚研提出 BCP,让模型自己决定何时重规划


2.2 per-chunk 监督不可辨识


每一次 horizon 决策都会与后续 chunk 以及之后的决策相互耦合。同一个最终结果可能由多种不同的 horizon 序列产生,因此并不存在唯一的 ground-truth 停止标签。基于这一点,研究团队放弃了监督学习,使用 GRPO 从轨迹级结果中进行优化。


北大与微软亚研提出 BCP,让模型自己决定何时重规划


2.3 纯成功率奖励会导致 horizon 塌缩


短 horizon 天然更加保守。如果只使用二值成功率作为奖励,策略很容易退化成频繁重规划,从而浪费昂贵的 VLA 调用。为此,论文设计了 Replanning-Efficiency Reward(RER)


北大与微软亚研提出 BCP,让模型自己决定何时重规划


三、实验结果


3.1 RoboTwin 2.0:VLA 方法中的 SOTA


以 LingBot-VLA 为底座,在原始成功率低于 90% 的 13 个低成功率任务上:


  • Clean:75.15% → 86.23%(+11.08%)
  • Randomized:73.54% → 83.46%(+9.92%) 


全部 50 个任务


  • Clean:89.88% → 93.94%(+4.06%) 
  • Randomized:88.78% → 92.84%(+4.06%) 


这一结果在所有对比的 VLA 方法中取得 SOTA,也接近了 WAM 的最佳结果。单任务上提升最显著的是 Hanging Mug:41% → 87%(Randomized 下 36% → 62%);其余如 Blocks Ranking Size(70% → 88%)、Turn Switch(60% → 72%)、Click Alarm Clock(80% → 91%)、Place Object Scale(80% → 91%)均为包含精度敏感抓取、放置或交互阶段的任务。


尤其需要注意的是,BCP 仅在 Clean 设定下训练,直接迁移到 Randomized 设定仍有 +4.06% 的一致增益,说明学到的并不是特定视觉条件下的过拟合,而更接近于「什么时候可以继续信任当前 chunk,什么时候必须重新规划」这类与任务阶段相关的知识。


这种提升在不同底座模型上同样成立:在 ABot-M0 上, 13 任务提升 +10.69%(Clean)和+11.77%(Randomized);在 ACT 上则提升 +5.38%。


北大与微软亚研提出 BCP,让模型自己决定何时重规划

图 3 RoboTwin 2.0 定性对比。BCP 在关键操作阶段前主动缩短 horizon(40 步 / 20 步)刷新观测,避免带着过时 chunk 执行。


3.2 LIBERO / LIBERO-PRO:任务越难,优势越大


在更强调泛化能力的 LIBERO-PRO 上,BCP 带来了 +6.8% 的提升,相比 AAC 高出 2.9 个百分点,并且在扰动幅度最大的 ×0.4 设定下优势最明显(16.8% vs 11.8%)。


北大与微软亚研提出 BCP,让模型自己决定何时重规划


3.3 更多重规划,却更低的总运行时间


北大与微软亚研提出 BCP,让模型自己决定何时重规划


Continuation head 每次推理仅带来 2.03 ms 的额外开销。虽然VLA 的调用次数略有增加,但由于动作执行更加准确、无效运动减少,总执行步数由 269 步下降至 248 步。在 50 Hz 控制频率下综合计算后,整体运行时间反而更低


在与 8 种执行策略(Random、Fixed 20/30/40、Action Trigger、Uncertainty Proxy、AAC、AutoHorizon)的 SR–runtime 权衡对比中,BCP 同时取得最高成功率与最低运行时间。Fixed 20 甚至没有超越 full-chunk 基线,说明更短的 horizon 并不天然更优;而 Uncertainty Proxy 与 AAC 因为需要采样多个 chunk 来估计不确定性或熵,运行时间明显更高。


北大与微软亚研提出 BCP,让模型自己决定何时重规划

图 4 50 个任务上的成功率–运行时间权衡。BCP(红星)同时位于最高成功率与最低运行时间处;Uncertainty Proxy 与 AAC 因需采样多个 chunk 而运行时间显著更高。


3.4 消融:三个组件逐一验证


北大与微软亚研提出 BCP,让模型自己决定何时重规划


通过消融实验可以得到三个非常清晰的结论:


其一,仅训练一个 16.4M 参数的轻量级 head,就能够基本追平微调 442.8M 参数 action expert 的效果(78% vs 79%),两者参数量相差约 27 倍。这直接支持了论文的核心判断——这一类失败很大程度上来自重规划时机的错配,而不一定是基座 VLA 动作生成能力不足。


其二,将 softmax 替换为 Bernoulli-Continuation Head 后,成功率进一步提升 +5%(78% → 83%),验证了显式建模 horizon 的序数关系和前缀共享结构的价值。


其三,加入 RER 后又带来了 +4%(83% → 87%)的提升,同时将 VLA 调用次数从 13.825 降至 10.158,运行时间从 21.55 s 降至 18.17 s。可以看到,在没有 RER 时,BC Head 确实存在向短 horizon 塌缩的保守倾向,对应的 VLA 调用次数也是最高的。


超参数实验还表明,候选 horizon 的粒度同样非常重要:将候选集合从 {15, 20, 25, …, 50} 换成更粗粒度的 {20, 30, 40, 50} 后,成功率从 87% 降至 78%——过于粗糙的候选集合会迫使策略在关键阶段停得过早或过晚。Transformer 深度方面,2 层效果最佳(1 层 82%,4 层 84%,6 层 83%)。


3.5 真机:AGIBOT G1


在 AGIBOT G1 真机上,研究团队以 LingBot-VLA 为基座,每个任务采集 250 条任务特定的遥操轨迹,并与 2000 条通用抓取轨迹联合训练 SFT 策略;随后仅用 128 条真实轨迹训练 BCP,基座 VLA 始终保持冻结。在评测时,每个任务在相同的 50 个 seed 上分别进行三次实验:


  • Grasping Bottle(瓶身光滑,抓取位姿容错低):74% → 92%
  • Hanging Mug(杯柄与挂钩相对位置误差须 < 2 cm):44% → 84%,同期 AAC 为 48% 


从执行序列可见,BCP 在接近与操作阶段主动缩短 horizon,在抓取与悬挂动作前刷新观测,从而生成更精确的动作。


北大与微软亚研提出 BCP,让模型自己决定何时重规划

图 5 真机 AGIBOT G1。抓瓶子 74% → 92%,挂马克杯 44% → 84%。


四、总结与局限


这项工作的价值并不只是成功率提升了几个百分点,更重要的是,它指出了一个长期以来被当成工程细节的问题:execution horizon 本身就是一个重要、而且可以用很低成本进行优化的决策维度。


当大量工作都在关注「如何把动作生成得更准确」时,这篇论文表明,相当一部分失败其实来自「机器人在错误的时机闭着眼睛继续执行」——而修复这一问题,只需要一个 16.4M 参数的轻量级 head。由于基座 VLA 全程冻结、即插即用,并且单次前向即可得到结果,BCP 对已经部署的 chunk-based VLA 系统具有很直接的迁移价值。


论文也明确指出了方法的边界:BCP 只负责决定什么时候停止执行当前 chunk 并重新规划,并不会修改 VLA 本身生成的动作。它的有效性依赖于基座 VLA 能够生成基本合理、可执行的 action chunk;如果预测出的动作本身就是错误的,那么仅仅调整 execution horizon 或重规划时机,依然不足以纠正整条轨迹。


作者简介


作者团队来自北京大学和微软亚洲研究院,共同一作 Weichen Xu 为北京大学在读博士生,目前在 MSRA 实习,共同一作 Zhenhua Liu 为 MSRA 高级研究员,通讯作者 Jiaolong Yang 担任 MSRA 资深研究员主管,研究方向是3D视觉和具身智能。


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner