模仿学习与强化学习:机器人操作该先用哪个

为什么多数机器人操作技术栈先用模仿学习、再考虑强化学习,各自何时取胜,以及两者如何结合。

阅读约 7 分钟

看一个现代操作策略学习叠衬衫,令人意外的是它需要的样本如此之少。一名遥操作员戴上头显,带着机器人手臂把叠衣动作走上几十遍,一个在这些片段上训练出的策略就能自己叠起来。再让一个强化学习智能体在同一套硬件上从零学同一项技能:它需要奖励信号、成千上万次尝试,以及每次失败后帮它把揉皱的衬衫重新铺平的人或夹具。同样的任务,账单却天差地别。

这道差距,正是 2026 年多数操作技术栈优先选择模仿学习、把强化学习放在其次(如果还会用的话)的安静原因。并不是强化学习不行,而是模仿学习绕开了让 RL 在真实机器人上举步维艰的两件事:为富接触任务手工设计稠密奖励,以及在会磨损、会失准、无法自我复位的硬件上采集数百万次试验。

有用的问题不是抽象地问哪种方法更好,而是各自在哪里物有所值,以及为什么当今最强的系统都以模仿为底座,把强化学习作为收尾环节加装上去。

复位问题,以及真实机器人上的 RL 为何昂贵

强化学习需要三样在电子游戏里廉价、在机器人上却昂贵的东西:奖励函数、大量交互,以及重新开始的办法。在仿真里这三样都免费。一个人形机器人可以在午饭前摔上十万次,场景瞬间就复位回初始状态。在真实硬件上,每一次摔倒都是磨损,每一次复位都是有人走过去把机器人扶起来、或把积木重新撒开,而每一个奖励都得用你手头真有的传感器去测量。

奖励设计是更隐蔽的陷阱。「把螺栓拧进去」没有天然的标量。团队最终只能一项一项地塑形奖励:到目标的距离、螺纹的对齐、对过大力的惩罚,而策略会愉快地钻这套规格里的每一个空子。富接触任务让情况更糟,因为有信息量的奖励往往只在最后、在一长串精确动作之后才出现。稀疏奖励加长时程,恰恰是免模型 RL 最不省样本的区间。

仿真回避了样本成本问题,却打开了 sim-to-real 的鸿沟:接触动力学、摩擦和可变形物体,正是仿真器建模得最差的部分。大规模并行仿真加激进的域随机化,已经让运动控制成为一个货真价实的 RL 成功案例,NVIDIA 的 Isaac 技术栈这类平台就是为推动这条流水线而生。而灵巧、富接触的操作,跨越这道鸿沟要慢得多。

模仿学习到底带来什么

模仿学习用示范换掉了奖励函数。最古老的形式行为克隆,只是从观测到动作做监督学习。它的经典弱点是误差累积:一个小偏差会把机器人带入没有任何示范覆盖过的状态,错误随之滚雪球。多年来这让纯克隆很脆弱。

近来的进步恰恰来自修补这一点。由 ALOHA 及其 ACT 模型推广的动作分块,一次预测一小段动作序列而非单步,从而抚平漂移。源自 Toyota Research Institute 与哥伦比亚大学一脉工作的扩散策略,把动作生成当作去噪过程,能处理多模态行为,也就是拿起一个杯子有许多种有效方式这一事实,而不会把它们平均成一团糊。这些方法每项任务只需几十到几百条示范,而非数百万条,就能学到可用技能。

随后是规模抬高了上限。跨形态数据集把各实验室的示范汇集起来:Open X-Embodiment 收集了约一百万条真实轨迹、涵盖 22 种机器人,DROID 又在众多真实场景中增补了大约 76,000 条遥操作轨迹。在这类数据上训练的视觉-语言-动作模型,包括 Physical Intelligence 的 pi-0、NVIDIA 的 GR00T 以及 DeepMind 的 Gemini Robotics,从网络预训练继承语义泛化,从示范获得运动落地。它们没有一个主要靠试错学会操作。

强化学习回答了模仿无法回答的问题:当没有专家可供模仿时该怎么办。而在真实硬件上,提出这个问题的代价,就是全部的故事。

强化学习仍然胜出的地方

模仿有一个硬天花板:克隆出的策略被示范它的人所限定。当任务需要人类无法很好遥操作的行为、或超出人类耐心的精度时,RL 就值回它的成本。

  • 高精度、富接触的插装。轴孔配合、连接器对接和手内重定向,涉及难以示范却易于用成功检测器打分的力与微调。在这里,RL 微调常常能补上最后几个百分点的成功率。
  • 动态与全身控制。行走、失衡恢复和投掷是最清楚的 RL 胜场,这也是 Boston Dynamics 和 Agility 的运动团队倚重它的原因。这些行为在物理上足够自洽,可以在仿真中训练并迁移。
  • 超越人类的优化。当你想要最快、最平滑或最省力的动作,而非最像人的动作时,一个目标函数胜过一条示范。

实际的套路很少是纯 RL,而是残差式或微调式 RL:从一个模仿策略出发,再让 RL 在一个狭窄的范围内修正它,用学习到的或脚本化的成功信号,而非手工塑形的稠密奖励。你既保住了模仿的样本效率与安全性,又只在能撬动指标的地方,才花费昂贵的真实世界交互。

两种方法,并排来看

模仿学习与强化学习在真实机器人操作上的对比
维度模仿学习强化学习
核心需求专家示范奖励函数与交互
硬件上的数据效率每项技能几十到几百条示范数千到数百万次试验
复位与安全负担低,示范只需采集一次高,需要复位与护栏
能否超越人类老师不能,受示范者限定能,它优化一个目标
最难的部分采集多样、干净的数据奖励塑形与 sim-to-real
最佳适用宽泛、语义化、多任务技能精确、动态、富接触的调优

多数团队真正交付的技术栈

翻看近期的发布,会浮现一个共同的形状。一个大型策略先在示范上做预训练,遥操作机器人数据,再加上越来越多的人类视频,然后用不多的在机示范适配到特定机器人与任务,只有到最后、如果那几个百分点还重要时,才用强化学习对着成功检测器做打磨。Toyota 的 Large Behavior Models 和上面那些 VLA 基础模型,无一例外都遵循「模仿优先」的脊梁;RL 是手术刀,而不是引擎。

原因既是技术的,也是经济的。示范是一笔固定、可预测的成本,随人手和台架而扩展。真实机器人 RL 是一笔可变成本,随你最不愿花费的东西而扩展:硬件时长和复位人力。只要有示范可用,它几乎总是更便宜的那一份。

所以诚实的表述不是模仿对阵强化学习,而是:模仿是那个廉价地得到一个称职策略的默认项,强化学习是那把推越人类可示范边界的定向工具。交付可用操作能力的团队并不在选边站,他们是在选顺序:先模仿,后优化,只在模仿用尽之处,才动用稀缺的真实世界交互。

imitation-learningreinforcement-learningmanipulationrobot-foundation-modelsdiffusion-policies

来源