合成数据与真实机器人数据:能奏效的配比
合成轨迹的数量已远超真实机器人数据,但真正能泛化的系统仍然两者兼用。本文讲清如何设定这一混合比例,也就是 sim data ratio。
NVIDIA 的机器人团队近期公布,借助围绕 Isaac GR00T 模型构建的生成式流水线,可在约 11 小时内生成 780,000 条量级的合成操作轨迹。相较之下,DROID 数据集里的 76,000 条真实遥操作轨迹,由一个横跨 13 家机构的联盟花了大约一年才采集完成。如果单看轨迹数量,这场较量似乎早已分出胜负。
但胜负并未分出。只用仿真数据或只用生成数据训练出的策略,总会撞上同一堵墙:机器人在演示视频里动作流畅,一到真实场景就抓不住第一条毛巾、拉不开第一个昏暗的抽屉、拿不稳第一件被仿真器猜错了摩擦系数的物体。过去两年真正有价值的结论,不是合成数据有用,也不是它没用,而是能够泛化的配方几乎都是混合的,而混合比例是一个会带来实际后果的设计决策。
所以值得问的问题不是「合成还是真实」,而是更锋利的一问:你的数据分布里,哪些部分可以廉价地造假,哪些部分必须在物理世界里挣得?从站队转向调配比例,正是关键所在。
四类数据,四种分工
机器人学习依赖四条供给线,而每一条都擅长其余几条所不擅长的事。
真实机器人遥操作提供精确的、与本体对应的动作标签,也就是真正产生该动作的关节指令。它同时也是运行成本最高的一条线。DROID、Open X-Embodiment(汇集了 22 种机器人本体、60 多个数据集、逾一百万条真实轨迹)以及 RH20T(10 万条以上的富接触序列)之所以存在,正因为大规模采集这类数据确实很难。
人类第一人称视频则是相反的取舍。仅 Ego4D 就有约 3,670 小时的第一人称人类活动,Ego-Exo4D 又补上了同步的第三人称视角。真实双手完成真实任务的覆盖面极广,边际成本很低,但它没有机器人动作标签,且人手与二指夹爪之间存在真实的本体差距。
物理仿真(Isaac Sim、域随机化及相关工具)扩展成本低、标签完美,还能安全地演练危险状态。它的短板是 sim-to-real 差距,而这一差距恰恰在操作最核心的地方最严重:接触、摩擦与可形变物体。
生成或神经视频是最新的一条线,用世界模型来合成轨迹,例如 GR00T 式的神经数据生成。它成本低、视觉多样,但其中的物理可能被悄悄地臆造出来,动作标签也只是近似值。
| 来源 | 动作标签 | 边际成本 | 边缘案例覆盖 | 主要失效模式 |
|---|---|---|---|---|
| 真实遥操作 | 精确、对应本体 | 高 | 窄 | 过拟合单一装置与实验室 |
| 人类第一人称视频 | 无(本体差距) | 低 | 极广 | 人到机器人的形态不匹配 |
| 物理仿真 | 精确 | 低 | 可调 | 接触与布料上的 sim-to-real 差距 |
| 生成/神经视频 | 近似 | 低 | 广(视觉) | 臆造的物理 |
真正上线的混合配方
看看领先系统披露的训练数据,规律相当一致:没有谁只用一种来源。
NVIDIA 将 Isaac GR00T 描述为在真实采集数据、人类视频与合成生成轨迹的混合上训练,正是为了让模型不受制于任何单一供给线。Physical Intelligence 明确表示,其 pi0 与 pi0.5 模型在一个异构的跨本体混合数据上联合训练,其中 pi0.5 更是围绕从广泛多样数据中获得的开放世界泛化能力来设计,而非依赖单一干净语料。Open X-Embodiment 的工作表明,在数十个汇集的真实数据集上联合训练同一个策略,胜过只在其中任意一个上训练,这正是联合训练论点的缩影。而丰田研究院的 Large Behavior Models 则以大量真实遥操作为主,辅以而非替代其他来源。
这个结论是结构性的,而非偶然。当一个团队只负担得起一种来源时,它会选真实遥操作,却在覆盖面上挨饿;当它负担得起多种来源时,它会保留一个真实锚点,再用更便宜的线去买广度。混合本身就是策略。
如何权衡这个比例
既然答案是混合,真正的功夫就在于选定比例。有几条经验法则在不同团队之间都站得住脚:
- 把真实的、上机的数据花在接触和与奖励相关的动力学所在之处。抓取可形变物、判断打滑、施加力度:这些恰恰是仿真器或视频模型最容易出细微错误的行为,所以要在这里为真实数据付费。
- 用仿真来换取覆盖面与安全。罕见失败、危险状态以及纯几何多样性,制造起来便宜,物理采集起来却繁琐。
- 用生成视频来换取视觉与语义多样性。光照、杂乱与背景,正是神经生成擅长变化、而遥操作装置采样很差的部分。
- 用一薄层真实的域内数据来锚定整体。在目标机器人上一小份精心挑选的微调集,往往就能补上仿真或生成预训练留下的大半差距。
比例会随问题而变。在移动运动的强化学习中,绝大多数经验来自仿真、只配一层轻量真实微调,是常态;而在富接触的操作中,天平会重新偏向真实遥操作,因为那正是仿真器误差咬得最狠的地方。
值得问的问题不是合成数据是否有用,而是你的分布里哪一片愿意造假,哪一片必须在物理世界里挣得。
比例在哪里失灵
混合会以特定且可诊断的方式失败。最经典的是 sim-to-real 差距:一个在刚体仿真里练到炉火纯青的策略,遇到真实布料或柔顺物体时,学到的动力学就不再成立。生成视频带来一种更隐蔽的版本,即臆造的物理,画面序列看似合理,动力学上却不可能,而在其上训练的策略会学到错误的因果结构。过多干净的仿真会造成协变量偏移:机器人从没见过险些失手的情形,一旦真实世界偏离示范轨迹,它便没有任何纠错行为。此外还有一种与动力学无关的来源失败,即混用授权与采集同意状况不清的数据集,随着 EU Data Act 之类的监管趋严,这正成为越来越大的责任风险。
这些问题都不算稀奇,每一个也都有标准的缓解手段:更多的域随机化、更好的真实锚点、显式的纠错示范、一条干净的来源溯源链。但每一种缓解都有代价,这正是为什么这个比例更像一份预算,而不是一个公式。
真正取得进展的团队,并没有在一场本就问错了方向的「合成对真实」之争里选边站。他们是在一源一源、一任务一任务地调配混合,并把这个比例本身当作一个关于世界的论断,一个值得测量、而非靠猜的论断。