机器人学习中的数据质量与数量

为什么覆盖度胜过原始时长:拆解 TRI 关于 Large Behavior Models 的多样性发现,以及如何按数据质量而非规模去读一个机器人数据集。

阅读约 6 分钟

在实验室里,一个操作策略以接近成品的成功率叠好一条蓝色毛巾。把毛巾换成红色,把桌子推到下午的阳光下,同一个策略就卡住了,伸手去够一道不再在它预期位置上的褶皱。团队的第一反应显而易见:再采集更多叠毛巾的示范。可它带来的帮助,往往远不及采集时长所暗示的那么多。

这正是当下机器人学习的核心难题。真实机器人数据很贵,遥操作数据尤其如此,而整个领域花了三年时间假设答案就是"更多数据"。后来,Toyota Research Institute 在构建其 Large Behavior Models 时,反复撞上一个不同的结论:真正拉动性能的示范,并不是对模型已经掌握的任务的又一次重复,而是覆盖了模型从未见过的条件的示范。是覆盖度,而不是原始时长。

这个区别听上去很学术,直到你算清它的成本。1000 条几乎一模一样的示范,和 1000 条横跨新物体、新光照、新视角与纠错行为的示范,采集成本大致相同,买到的却是截然不同的模型。本文拆解其中的原因,说明这些关于多样性的发现究竟讲了什么,以及如何按覆盖度而不是按标题上的小时数去读一个数据集。

实验室到厨房的落差,本质是覆盖度问题

今天大多数操作策略靠模仿来训练:人做遥操作,机器人学着照做。模仿学习有一个众所周知的失效模式。策略只在它训练时见过的状态分布上可靠,而一旦机器人漂移到没有任何示范覆盖过的状态,误差就会累积。一次小小的抓取偏差把场景推入陌生地带,下一个动作就更差一点,几步之内,整条轨迹已经完全离开了训练分布。

对此,再多"已解任务"的示范也帮不上什么忙。它们只是加深策略已经找到的那个峰,在它本就应付得来的状态上把行为磨得更锋利,却没有拓宽它能从中恢复的状态范围。真正管用的是支撑集:那些触及策略当前无从模仿的状态空间区域的示范。这就是为什么新光照下的一条红毛巾,能击垮一个把蓝毛巾叠得完美的策略。这不是叠毛巾的失败,而是覆盖度的缺口。

这些多样性发现究竟说了什么

TRI 的 Large Behavior Model 工作,把 Open X-Embodiment 协作早已暗示的一点讲清楚了:把跨越许多任务、甚至许多机器人本体的多样数据汇集起来,往往会提升而非稀释单一任务上的表现。在汇集后的 Open X-Embodiment 数据上训练的 RT-X 模型表现出正迁移,一个在多种本体上训练的策略,胜过只用目标机器人自身数据训练的同一策略。看似无关的任务仍在传授共享的结构:物体如何运动,接触如何化解,夹爪遮挡是什么样子。

推论是一条大多数团队都低估了的收益递减曲线。一个任务最初的那些示范价值很高。等到你在同一套装置上攒了几百条干净的成功样本,每多一条几乎教不会模型任何它还不知道的东西。同样的预算若花在一个新物体、一个新房间或一种新的失败模式上,能买到多得多的能力。

边际的那条示范,值多少完全取决于它教会了模型此前示范没教的东西。过了某个点,再复制一份已解任务,几乎什么也教不了。

读数据集:时长 vs 覆盖度

一旦你开始数覆盖度而不是数时长,公开数据集的排序就变了。一份庞大的单任务日志,携带的可用信息可能少于一份刻意在场景、物体和视角上铺开的较小集合。下表列出几个被广泛使用的数据集的公开数字,用来展示它们的设计取舍有多不同。

若干开放操作与第一人称数据集的公开规模。数字为近似值,以各项目公布为准。
数据集公开规模覆盖度侧重
Open X-Embodiment约 100 万条轨迹,22 种机器人本体,21 家机构跨本体汇集
DROID约 76,000 条轨迹,约 350 小时,564 个场景,52 栋建筑真实环境中的场景与任务多样性
RH20T约 110,000 条富接触序列,约 147 个任务力与接触的多样性
Ego-Exo4D约 1,286 小时,740 名相机佩戴者,第一与第三人称配对视角熟练人类活动,多视角
Ego4D约 3,670 小时第一人称视频,横跨 9 个国家大规模日常人类覆盖

注意最后两行是什么:人类视频,而非机器人日志。像 Ego4D 和 Ego-Exo4D 这样的数据集完全不含机器人动作,却覆盖了任何遥操作项目在成本上都无法匹敌的物体、手部与环境广度。它们在训练配比中的作用,正是覆盖度论点的另一种形式:用廉价的广度,去补足昂贵而精确的机器人示范。

有用的信息比特藏在哪里

"多样性"这个词太粗略,说不清真正要紧的东西。少数几个具体维度承载了大部分价值:

  • 物体与场景:策略从未被要求忽略过的新实例、杂物、干扰物与背景。
  • 视角与本体:不同的相机位置与机器人本体,迫使模型去学习什么是不变量,而不是记住某一种几何。
  • 光照与时段:最便宜的多样性,也是实验室到现场性能回退最常见的原因之一。
  • 失败与恢复:从一个错误出发、再回到良好状态的示范。它们教给策略的,正是干净的成功样本给不了的那件事:漂移出分布之后,如何回到分布上来。

恢复数据是这四者中最被低估的。Physical Intelligence 等构建通用策略的团队主张,稳健性更多来自展示机器人如何犯错并自我纠正的数据,而非完美无瑕的示范。一份只有完美运行的数据集,某种意义上,正是在部署机器人度过最艰难那几秒的那块区域,开了一个洞。

多样性也有它的代价函数

这一切并不意味着为了熵而追求熵。你不能把任意数据倒进配比里就指望有收益。标注错误的轨迹、粗糙的遥操作,以及来自离目标太远的本体的示范,添加噪声的速度会快过信号。多样性与质量不是对立面,它们是盟友,而两者共同对立的,是大量近乎重复的原始时长。真正的目标,是对机器人实际会遇到的条件的覆盖:采样干净、标注诚实、并向长尾而非容易的中心加权。

这重构了采集问题。要问的不是"我们记录了多少小时",而是"部署分布里还有哪些切片我们尚未覆盖,用什么最便宜又诚实的方式去把它们填上"。有时答案是更多的机器人遥操作。更多时候,是人类示范、仿真,或者只是为你本就要采集的数据,制定一份更有章法的采样计划。

交付出最强机器人的团队,并不是原始日志最多的那些。而是对于任意一项技能,都能告诉你是哪一部分数据教会了它、又还缺哪一部分的团队。数的是覆盖度,不是小时数。

data-qualityrobot-learningdata-diversityimitation-learningdatasets

来源