行为克隆详解:默认之选,及其局限

行为克隆是机器人学习的主力方法。它为何成为默认选择,复合误差为何让它失效,以及更好的数据如何补救。

阅读约 6 分钟

给一只机器人手臂看两百个干净的抓杯子示范,它就学会了抓杯子。可只要把杯子往左挪十厘米,挪到任何一次示范都没覆盖过的位置,手臂依然会信心十足地伸向一片空气。没有任何信号提醒它,策略甚至从未表现出一丝迟疑。

这种失败正是行为克隆(behavior cloning)的典型特征。今年你看到的大多数操作演示,底层跑的都是这套方法。它简单,随数据规模扩展,并且以一种可预测的方式失效。搞清楚它究竟在哪里失效,比任何榜单分数都更能告诉你:一条采集管线到底该产出什么。

所以值得把三件事讲清楚:行为克隆做的是什么,它为什么会成为默认选择,以及是什么机制注定了它朴素版本的失败。

行为克隆到底在做什么

行为克隆把控制问题当作监督学习来处理。你收集一批示范,每一条都是一串观测-动作对:机器人看到了什么,专家接下来做了什么。然后你拟合一个把观测映射到动作的函数,尽量缩小模型预测动作与专家动作之间的差距。没有奖励函数,没有仿真器,没有探索。只要人能演示这个任务,原则上你就能把它克隆下来。这正是 DROID 这类遥操作数据集,以及 Open X-Embodiment 这类聚合语料如此重要的原因:它们就是这套方法燃烧的燃料。

它的吸引力很实在。强化学习需要一个你能写清楚的奖励,以及你负担得起的数百万次试验。对富接触操作来说,这两点都很痛。行为克隆用示范换掉了奖励工程,而一个熟练的遥操作员可以整天产出示范。像 LeRobot 这样的开源工具链如今已经把训练循环、数据格式和预训练权重都打包好了,跑出第一个能用的策略只需要一个周末,而不是一个季度。

它为什么成了默认选择

三股力量把行为克隆推到了具身智能的中心。

  1. 数据终于跟上了。十年前,还没有一个值得用来预训练的共享操作语料。如今已经有了横跨众多机器人本体的真实规模,而克隆是唯一一种几乎不需要繁文缛节、就能把原始示范变成策略的方法。
  2. 它搭上了预训练的车。现代视觉-语言-动作(VLA)模型先在广泛的网络视觉与语言上预训练,再通过克隆行为为这份知识接上一副身体。Physical Intelligence 大体就是这样构建 pi0 的:在一个大型预训练骨干之上叠加模仿学习,这一点在其 公开笔记 中有所描述。
  3. 它的失败是可读的。当一个克隆策略出问题时,你通常能回头指着示范数据,看出漏洞在哪。这种可调试性在日常工作中,比榜单上一点点微小的提升更重要。
行为克隆与强化学习各路方案的对比
方法需要什么数据胃口最擅长主要失效模式
行为克隆专家示范中等,对质量敏感快速起步、富接触技能分布漂移
离线强化学习带奖励标注的日志数据大,可容忍质量参差从不完美的日志中榨取信号价值高估
在线强化学习仿真器或安全试验加奖励试验次数极大渐近的峰值性能奖励设计与 sim-to-real 差距

它在哪里崩溃:复合误差

机制是这样的。克隆策略只在专家访问过的状态上受过训练,因为数据里只有这些状态。测试时,策略犯了一个小错,落到一个偏离专家路径一丝丝的状态。这个状态从未出现在训练里,于是下一步预测会差一点,把机器人推得离路径更远,让再下一步预测更糟。误差不是相加,而是复合累积。研究者把这称为协变量漂移,或分布漂移。这正是为什么一个单步精度很高的策略,仍然会在长任务上失败。BAIR blog 上反复讨论过这一点,DAgger 这条研究脉络也发端于此。

时程是那个放大器。两秒钟的抓取能容忍很多误差,而九十秒的装配序列,等于给漂移留了九十秒去累积。

行为克隆学会的是在专家访问过的状态里该做什么。它全部的麻烦都在于专家从未访问过的状态,而机器人只要一犯错,就立刻踏进了那里。

各种补救,以及它们对数据的要求

每一个认真的补救办法,攻击的都是同一个缺口,而其中大多数,其实是伪装成算法的数据策略。

  • 把专家重新放回环路。DAgger 会运行当前策略,记录它实际到达的状态,然后向专家询问在那里的正确动作。数据集因此朝着策略真实的分布生长,而不是专家那条整洁的路径。
  • 按块预测。动作分块(action chunking)与时间集成让模型一次性承诺一小段未来动作,减少了漂移可以趁虚而入的决策点数量。
  • 建模整个动作分布。扩散策略(diffusion policy)表达了岔路口上“同时存在多个好动作”这一事实,而不是把它们平均成一个糟糕的折中,后者正是克隆的经典失败。
  • 把恢复过程也采下来。最便宜的补救往往是更好的数据:包含滑脱、重新抓取和纠偏的示范,让策略见过犯错之后该怎么办,而不只是见过怎样做到完美。

这条主线让任何贩卖干净数据的人都不太舒服:一份只有完美成功的语料,恰恰教会策略在踏出示范路径的那一刻变得束手无策。

真正决定部署成败的那个变量

行为克隆不会消失。它是几乎每一个人形机器人技术栈赖以搭建的底座。但把它当成一个能把示范变魔术般变成技能的黑箱,会掩盖那个真正决定策略能否在真实世界存活的唯一变量:它的训练状态,对它将要真正遇到的状态,覆盖得有多好。最终胜出的团队,不会只是采集更多示范。他们会采集对的那些,包括那些一场干净的实验室拍摄很想丢掉的、不体面的恢复过程。

behavior-cloningimitation-learningpolicydistribution-shiftdatasets

来源