机器人学习中的样本效率
两个团队训练同一项技能:一个需要 10,000 次示范,另一个只需 200 次。样本效率,以及先验、结构和更好的数据如何赢得它。
两个团队着手教机器人同一项开抽屉的技能。一个团队采集了一万次示范,得到一个大多数时候能用的策略。另一个团队采集了两百次,得到的策略反而更好。差别不在机器人身上,而在于两队各自在第一次示范之前,为这个问题带来了什么。
样本效率,是你从每一次示范中榨取出的技能量。在语言建模里它几乎不成话题,因为文本近乎免费,可以按 TB 抓取。在机器人领域它却是全部关键。一次示范是一个人实时操作硬件,没有什么网络可供抓取。每一条轨迹都要花费数分钟、器件磨损和人的注意力。
所以有意思的问题不是如何采集更多,而是如何需要更少。三个杠杆承担了大部分工作:你出发时的先验、你施加于问题之上的结构,以及你采集数据的质量。
先验:先付一次,往后就少付
削减示范数量最快的办法,就是别从零开始。一个在看到你的任务之前就已经理解物体、接触和语言的策略,只需一小部分数据,就能学会一个空白网络需要海量数据才能掌握的东西。
这正是机器人基础模型的全部论点。一个跨越多种任务和本体预训练过的网络,例如 NVIDIA Isaac GR00T,携带着新模型所缺乏的先验,因此在新技能上做微调时收敛更快、所需数据更少。Physical Intelligence blog 所介绍的通用策略押的是同一个赌注:把广泛的经验一次性吸收进来,之后再低成本地适配。预训练并不会让示范变得免费,它改变的是你达到某个成功率所需的示范数量,而这个数字才真正出现在账单上。
网络视频也是一种先验。一个看过人们操作物体的模型,即便没有动作标签,也带着对手和物体如何运动的感觉到来。这种先验是粗糙的,但它仍然能从微调预算里省下一批示范。
这里的教训很直白。花算力把一个强先验建好一次,往后每一个采集示范的下游团队,都会为此少付许多年的账。正因如此,机器人学习的经济账越来越偏向那些能把一次大规模预训练摊薄到许多任务上的团队,而不是让每个新项目都从一个冰冷、无知的网络重新起步。
结构:问题的形状决定它的成本
第二个杠杆是表征。你如何界定观测与动作,会改变策略所需的数据量,有时相差一个数量级。
以动作空间为例。以高频率预测原始关节力矩,表达力强,却很吃数据,因为策略必须硬生生学会动力学。预测末端执行器的路点,则把大部分负担交给了控制器,于是策略要学的决策更少、也更有意义。关键点表征和以物体为中心的表征走得更远:一个推理「杯柄在哪里」而不是原始像素的策略,只需少得多的样本就能泛化到新的杯子。
| 杠杆 | 如何赢得效率 | 代价是什么 |
|---|---|---|
| 先验(预训练) | 从广泛经验出发,新技能只需少量示范 | 庞大的前期语料与算力;存在领域差距的风险 |
| 结构(表征) | 更好的动作或状态空间,替策略免去要学的东西 | 工程投入,以及可能出错的假设 |
| 数据质量(覆盖度) | 多样、覆盖良好的示范,每个样本教得更多 | 细致的采集、筛选,以及诚实的评估 |
技能结构同样重要。把一个长任务拆成可复用的基元,意味着每个基元都在所有包含它的回合上受训,而不只是在整任务示范上受训。同样是两百次厨房示范,一旦切分开来,就能产出多得多的抓取样本,于是抓取基元学习到的有效样本,远比原始回合数看上去要多。
最廉价的示范,是你从来不必采集的那一次,因为一个先验或一个更好的表征已经把它覆盖了。
数据质量胜过数据数量
第三个杠杆,团队往往最后才想到,其实应该最先想到。并非所有示范都携带同样的信息。一千次几乎一模一样、在同一位置拾取同一方块的示范,在头五十次之后就几乎教不了策略任何东西。而五十次分散在不同光照、杂乱、物体形状和起始位姿下的拾取,才教会它泛化。
真正要紧的指标是覆盖度,而不是数量。DROID dataset 正是围绕这一理念构建的:许多场景、许多物体、许多操作者,好让在其上训练的策略见到的是多样性,而非重复。Berkeley BAIR blog 的工作反复表明,训练集中的多样性比单纯的规模更能预测泛化能力。
失败与恢复数据也属于这里。一个只由干净成功案例组成的语料库,只教会策略在一切顺利时该做什么,却对如何在出岔子时恢复只字不提。既然部署环境大多是那段乱糟糟的中间过程,一个包含险些失手和纠偏的较小数据集,往往胜过一个全是完美执行的较大数据集。操作者在现场就能体会到这一点:最能教会策略的示范,很少是录起来最顺滑的那些。
诚实地度量效率
样本效率很容易自欺欺人。如果你的测试集与训练集相似,那么数据越多看起来总是越有帮助,因为你是在奖励死记硬背。诚实的度量,是在真正留出的条件下(新物体、新背景、新起始状态)达到目标成功率所需的示范数量。像 Hugging Face LeRobot 这样的开源工具,让这类受控对比更容易运行,也更容易复现。
用采集更多数据来修补一个孱弱策略的本能,通常是对错误问题给出的昂贵答案。当新数据确实不同时,更多数据才有帮助。当它只是重复模型早已见过的东西时,它只会撑大语料库和账单,却挪不动成功率。在成本上取胜的团队,不是拥有最大数据集的那些,而是那些从强先验出发、把问题框定得让策略少学一些、并把采集预算花在覆盖度而非重复上的团队。