从演示到部署:机器人训练流水线
预训练、后训练、sim2real 与评估不是一张清单,而是由数据和诚实评估闭合的同一个循环。一份写给工程师的机器人训练流水线实战指南。
看一个操作策略失败,比看它成功更能说明问题。一个在实验台上能完美倒水的模型,一旦光照变化、桌面高出 3 厘米,或者杯子从哑光变成亮面,就会够不到杯口。演示看起来像是智能,真正出问题的却是一条流水线,出在某个具体阶段,原因还可以被清楚地指认。
多数文章把机器人基础模型描述成一条直线:采集数据、预训练、微调、部署。这种说法很省事,却并不正确。pretrain、post-train、sim2real 与评估并不是只走一遍的顺序流程,而是一个由评估闭合的循环,你要反复走很多遍,每走一遍都会改变你下一步该采集什么数据。真正能交付可用策略的团队,把这四个阶段当作一个带反馈边的系统,而不是四个各自为政的部门。
本文有一个明确立场:这个循环里真正的约束不是模型架构,架构正在收敛、而且越来越开放和共享;真正的约束是演示数据,以及你的评估是否诚实。把这两件事做对,平庸的架构也能奏效;做错,排行榜上最强的 VLA 照样会把杯子碰倒。
四个阶段,一个循环
在展开细节之前,先给出这张地图。每个阶段都有它的目标、典型的数据来源,以及它悄悄失效的方式。
| 阶段 | 目标 | 数据来源 | 主要失效方式 |
|---|---|---|---|
| 预训练 | 通用视觉-运动先验 | 汇集的跨本体与人类视频 | 先验离你的机器人和场景太远 |
| 后训练 | 在你的硬件上形成任务能力 | 目标机器人上的遥操作演示 | 演示太少、相关性太高 |
| Sim2real | 规模化稀有、昂贵或危险的条件 | 物理仿真加域随机化 | 接触与可形变物体撑破仿真鸿沟 |
| 评估 | 衡量真实进展而非代理指标 | 真机试验、留出场景 | 廉价指标无法预测现场表现 |
预训练:向别人的机器人借来广度
没有哪个实验室能靠遥操作攒出足够的小时数,从零教会模型视觉与物理世界,因此预训练借的是广度。Open X-Embodiment 把来自 22 种机器人本体、大约一百万条真实轨迹汇成一个混合集,在这个汇集集上训练的模型,比只在任何单一机器人上训练的迁移得更好。NVIDIA Isaac GR00T 与 Physical Intelligence 的 pi-zero 走的是同一套配方:一个视觉-语言骨干承载语义先验,一个动作头学习运动先验,两者都先在异构混合集上预训练,然后才见到你的任务。
人类视频是广度的另一半。数千小时的日常第一人称录像(Ego4D),以及大约 1,300 小时时间同步的第一与第三人称采集(Ego-Exo4D),给模型关于手如何接近物体、任务如何分解、下一步合理动作长什么样的先验。一个人产出富接触、与任务相关行为的速度和成本,都远优于一只遥操作的机械臂。代价是:人不是机器人,若你跳过下一个阶段,这些数据作为先验有用,作为直接目标则有害。
后训练:最后一公里决定策略
预训练给的是泛泛的能力,后训练给的是在你的机器人、你的工作单元、你的任务上的能力,而大部分已部署的性能,正是在这里被赢下或输掉。这里的数据又小又贵:目标硬件上的遥操作演示。DROID 是质量上的参照,在统一配置上采集的 76,000 条遥操作轨迹、覆盖 564 个场景,它有价值恰恰因为多样且经过标定,而不只是量大。像 RH20T 这样的富接触语料,规模大约 110,000 段,把同样的思路推向更用力、多步骤的任务。
失效方式很隐蔽。一名操作员在一个下午采集的两百段演示高度相关:相同的抓取方式、相同的光照、相同的杂乱背景。策略会过拟合到操作员的习惯,并在与这些习惯相同的评估里表现出色。像 Hugging Face LeRobot 这样的开放流水线让这些数据集易于标准化和共享,这有帮助,但没有任何格式能修好一个只见过一种做法的语料。
Sim2real:便宜的数据,真实的税
仿真是唯一能在不损坏硬件的前提下,把危险或稀有条件跑上百万次的办法。域随机化,即改变光照、纹理、质量与摩擦,让真实世界看起来只是又一个样本,正是它让仿真训练出的策略能在接触真实后存活。对运动控制与全身控制,这一招效果出奇地好:那里的主导物理是仿真器擅长的刚体动力学,NVIDIA 的 GEAR Lab 与 Isaac 技术栈也在这方向上用力最深。
但对人们最想要的任务,它就差得多:对柔软、可形变或带关节物体的富接触操作。一个无法忠实建模折叠毛巾、拉链或打滑抓取的仿真器,会训练出一个自信却在真实物体上失败的策略。诚实的经验法则是:仿真便宜地给你动力学和几何,却在接触与形变上收取一笔高昂且常被隐藏的税。Sim2real 不是免费数据,而是一笔以你评估预算为抵押的贷款。
评估:没人拿来演示的瓶颈
上面每个阶段都由同一个裁判打分,而这个裁判很贵。真机评估慢、噪声大、难以复现:同一个策略在周二得分不同,只因为光变了。仿真与离线指标便宜,却经常与真机成功率不一致,于是一个策略可能在离线曲线上向上爬,却在工作单元里越来越差。Toyota Research Institute 关于大行为模型(large behavior models)的工作对此直言不讳:跨大量试验与场景的严谨真机评估,才是真正告诉你上一次改动是否有用的那一部分。
多数机器人演示展示的是多次里最好的一次。真正重要的流水线,是在你上线之前,诚实地告诉你平均一次是什么样的那一条。
这正是为什么闭合循环的是评估,而不是架构。一个可信的评估会告诉你下一步该投资哪个阶段:拓宽预训练混合集、采集更多样的后训练演示,或者别再相信某个仿真资产。一个讨好你的评估只会让你原地打转。
下一次你看到某个策略在台上叠好一件衬衫,单凭这一点几乎说明不了什么。有用的问题是:它究竟在四个阶段里的哪几个上真正闭合了循环、那个数字背后站着多少次真机试验、又是谁的演示教会了它这个动作。答得上来,你就能把一条流水线和一段高光剪辑区分开。