为什么人类演示数据比脚本数据更具扩展性

脚本轨迹干净又便宜,但在基础模型规模上真正带来泛化的是覆盖度。为什么人类演示数据是训练机器人策略更具扩展性的基座。

阅读约 6 分钟

一名遥操作员在一台人形机器人后面坐了 6 个小时,采集了 400 条干净的单一任务演示:拉开抽屉,放下马克杯,再合上抽屉。每一条轨迹都平滑、带标注,而且几乎一模一样。而在走廊另一头,一整间咖啡馆的人整个上午都在打开各式抽屉:用胯部顶,用两根手指,用整只手掌,一边还拿着手机,抽屉卡住之后再拉一次。这两股数据流里,一股看起来像训练数据,另一股看起来像真实世界。

这一对比几乎就是全部论点。脚本数据为整洁与可控而优化,人类演示则为覆盖度而优化。在机器人策略开始具备泛化能力的规模上,真正带来回报的属性是覆盖度,而如今公开数据集已经用数字而非感觉把这一点说清楚了。

在继续之前先给两个定义。我说的 脚本数据,指的是机器或受到严格约束的遥操作流程有意生成的轨迹:运动规划的抓取放置、带域随机化的仿真回放、把同一个任务重复到缓冲区填满为止。我说的 人类演示数据,指的是真实的人在实际执行任务时的记录,并且越来越多地以第一人称、即自我中心(egocentric)视角采集。二者的区别不在于单帧的质量,而在于分布的形状。

脚本数据究竟能买到什么

脚本数据与仿真数据有实实在在的优点,值得诚实地讲清楚。管线一旦建好,它就能低成本地大量生产。它标注完美:动作、接触、物体位姿你都知道,因为都是你自己生成的。它安全、可复现,且容易在各类别之间做平衡。用来预训练策略的底层运动先验,这是一块很结实的地板。

但它的失效方式是结构性的。脚本数据只能覆盖你想到要去编码的那部分变化。域随机化确实拓宽了分布,但只沿着你选择去随机化的那些轴:光照、纹理、摩擦、质量。真正让已部署机器人翻车的情形,往往落在这些轴之外,落在杂乱货架、可变形物体、半开容器与人为干扰这条长尾里。一个主要在脚本上训练出来的模型,学到的是脚本本身。它会按你演示的方式完成任务,而在世界第一次不肯配合时就卡住。

覆盖度才是全部

泛化有一个朴素的操作性含义:在你没有训练过的状态上也表现良好。要做到这一点,你需要训练状态足够贴近测试状态,也就是说你需要覆盖度。同一个狭窄任务再多来一些,并不会增加覆盖度,只会让你在已经占据的地盘上更有把握。

Open X-Embodiment 给这一点标上了数字。它汇集了约 100 万条真实轨迹,横跨 22 种机器人本体、60 个组成数据集;在这一混合数据上联合训练的模型,表现优于同样模型在任何单一来源上的训练结果,技能也在从未共享过数据集的机器人之间迁移。驱动力不是某个狭窄来源的体量,而是多样性。DROID 则给出环境层面的版本:76,000 条刻意在真实场景中采集的遥操作轨迹,覆盖 564 个场景、52 栋建筑,用它联合训练的策略在未见过的场景上,泛化明显好于规模相近的实验室内数据。

务实地读,这是一条曲线。在同一个厨房里再加第一万条拉抽屉,回报正弯向零。换一个厨房、换一个物体或换一种策略,则还在持续付钱。哪种数据源能让这条曲线弯得最慢,哪种就最具扩展性。

只在脚本轨迹上训练的策略,只知道打开抽屉的一种正确方式。在人类演示上训练的策略,见过上千种几乎出错却又被挽回的方式,而稳健性大半正是由这种挽回构成的。

为什么人类是更好的采样器

杠杆就在这里。人们每天都在无成本地演示着长尾,不占用任何数据预算,而自我中心采集把这种行为变成了语料。Ego-Exo4D 记录了约 1,300 小时的技能性活动,来自 13 座城市的 740 名参与者,并配有时间同步的第一人称与第三人称视角;更早的 Ego4D 则从数十个地点、数百名相机佩戴者那里采集了约 3,700 小时。没有任何机器人遥操作项目能达到这样的人群、地点与策略跨度,因为它做不到:每一小时都要消耗一台机器人和一名操作员。

这一领域自己的配方早已承认这一点。NVIDIA 的 Isaac GR00T 基础模型,训练所用的混合数据在真实机器人与合成轨迹之外,也倚重人类视频;Physical Intelligence 训练其跨本体策略时,用的是众多机器人与任务,而非单一的干净来源。当这些构建人形基础模型的团队去取用多样的人类与跨本体数据时,那不是点缀,而是承重结构。

把取舍并排摆开

这一切并不意味着人类数据就一定更优。它只是一组取舍上的另一个点,而要选得好,就得看清整盘棋。

三种数据源在训练操作策略时的取舍对比
属性脚本 / 仿真遥操作机器人人类演示
扩展成本建成后很低高:机器人工时、操作员低到中等:可穿戴,无需机器人
长尾覆盖度狭窄,限于所选轴中等广
动作标注精确,直接生成精确的机器人动作间接:需位姿估计与重定向
本体匹配与仿真一致与该机器人一致存在形态差距
接触真实度低到中等高,但力未标注
边际收益递减中等

人类优先在哪里会失灵,以及诚实的补救

真正该让你担心的那一列是动作标注。人类演示给你看的是手,而不是关节指令;你观察到的是结果,而不是控制器。要把它变成机器人可以模仿的东西,需要先做手部位姿与物体位姿估计,再重定向到机器人的形态上,而这些环节每一步都在累积误差。五指的重新抓握,在两指夹爪上没有干净的对应形象,因此有些人类策略就是无法迁移。

补救办法是已知的,而且越来越标准。配对采集是主要一招:DROID 式的多视角装置、Ego-Exo4D 同步的自我中心与外部视角相机,以及 RH20T 配对的人类与机器人序列,存在的意义都是为重定向这一步提供有监督的桥梁。正确的结论不是人类数据取代机器人数据,而是一种分工:把充裕的人类演示花在多样的基座上,把稀缺的机器人工时花在接地,以及形态差距真正咬人的最后一公里技能上。

基座与顶端

把脚本数据看作它本来的样子:一块用于运动先验的干净而廉价的地板,而不是通往通用策略的道路。覆盖度才是把策略从一次演示变成一项技能的属性,而人类演示是我们拥有的最广、最便宜的覆盖度来源。真正能扩展的团队,看起来不会像一支机器人舰队死磕同一个任务,而更像一个采集得当的宽广人类基座,把机器人工时花在最值钱的地方。先采集世界,再教会身体。

human-demonstration-datascalable-robot-datadata-diversityegocentric-capturerobot-policy

来源