机器人的 scaling laws 之问:数据越多,策略越好吗

更多数据是否意味着更好的机器人策略?LLM 的 scaling laws 类比在 VLA 模型上何处成立,又在哪三个关节上失效。

阅读约 6 分钟

把超过 100 万条来自 22 种形态的机器人轨迹汇集起来,用单一策略在整堆数据上联合训练,真正令人意外的并不是它能跑通,而是数字提升得如此有限。这是 2023 年 Open X-Embodiment 协作的一个启示:这项把 60 多个数据集、来自 21 家机构合并进单一训练混合的工作确实带来了正向迁移,却完全不像语言模型那样,每喂进更多文本就稳步攀升出一条干净的曲线。

底层的问题很好说,却很难答。大语言模型遵循 scaling laws:在合适的比例下给它更多参数、更多 token、更多算力,损失就会沿着一条能外推数年的幂律下降。机器人策略是否也如此?如果 Physical Intelligence、一批人形实验室,以及 Roborecs 都押注于「更多示范数据买来更好的行为」,那就值得追问:这个赌注究竟在哪里奏效,又在哪里悄悄失灵。

诚实的答案是:更多数据确实有用,但机器人这条曲线被一个语言曲线基本忽略的因素所主导,那就是覆盖度。一个机器人策略的上限,取决于它的数据触及了世界的哪一小片;而物理接触的世界,比互联网上的文本要宽广得多,采样成本也高得多。

语言的 scaling laws 到底承诺了什么

2020 年的 Kaplan 结果与 2022 年 Chinchilla 的修正,交给这个领域一个公式。测试损失随模型规模、数据规模与算力以幂律下降,而这三者需要同步增长。它为什么成立,值得直说。语言预训练是自监督的,网上每一句话都是免费的监督信号;训练目标「预测下一个 token」在训练时与测试时完全一致;而万亿 token 量级的语料早已存在,没有人需要去制造它。

机器人无法免费继承这三条性质里的任何一条。服务器上并没有一份万亿轨迹级的操作语料;训练目标「模仿一个动作」并不是机器人部署时面对的任务,因为它必须从自己的错误中恢复;而每一个数据单位都要花掉真实的硬件时间。

类比在哪里仍然成立

并非全是分歧。过去三年最有生产力的想法,是让一个机器人策略去借用一个已经为自身 scaling 付过账的语言或视觉骨干。视觉-语言-动作(VLA)模型,包括 RT-2、Gemini Robotics、Physical Intelligence 的 π0,以及 NVIDIA Isaac GR00T,都从一个网络预训练的 VLM 出发,在其上嫁接一个动作解码器。语义先验,比如杯子是什么、「擦掉溢出的液体」意味着什么,是免费到手的;RT-2 也表明,其中一部分语义泛化能延续到机器人的行为里。策略只需要学习运动落地的最后一公里。

跨形态汇集也能迁移,但有限度。RT-X 表明,在多台机器人上训练的策略能胜过单机基线。DROID 这份约 76,000 条示范、覆盖 564 个场景、在 13 家机构采集的数据集,正是为了让场景与任务的多样性、而不仅是数量,去喂给模型。

类比在哪里破裂

现在来看类比出现裂缝的几个关节。

误差会累积。语言模型预测错一个 token 就翻篇了;策略却是闭环运行的:一个小误差把机器人推入训练数据从未覆盖的状态,下一个动作更糟,轨迹逐渐偏离数据流形。这种协变量偏移意味着,真实世界中的性能可能比任何离线损失曲线预测的都退化得更快。

数据不可互换。多一个 token 是可以互换的;多一条来自不同夹爪、相机位置或控制频率的轨迹却不是。形态差异意味着来自一台 Franka 机械臂的数据,无法干净地迁移到人形机器人的手上,因此你不能简单地把一切相加,就指望这一堆会有帮助。

每一秒都得有人买单。遥操作示范在真实硬件上实时进行。没有抓取式的捷径,也没有任何能完全替代接触的合成语料。

数据经济学的差异:语言 token 与机器人经验
属性语言 token机器人轨迹
来源已在网络上必须在硬件上采集
监督自监督,免费遥操作或人类示范,按秒付费
训练与测试目标一致开环模仿,闭环部署
边际单位可互换与形态绑定
scaling 瓶颈算力与 token对部署分布的覆盖度

到底什么才真正见效

如果单靠数量不是杠杆,那杠杆是什么?过去两年的证据指向多样性与分布,而不是数量。

在机器人领域,有用的坐标轴很少是你有多少条示范,而是它们触及了多少部署世界,以及你把多少留在了未见之地。

有三个杠杆反复出现。场景与物体的多样性,让策略在多种条件下都见过接触。示范的质量与一致性,因为策略会模仿老师的习惯,好的坏的都学。以及对长尾的定向覆盖,也就是部署中的机器人真正会失败的那些罕见状态。Toyota Research Institute 的 Large Behavior Models 工作主张,广泛的多任务预训练会让每一项新技能都更便宜地加入,这种复利回报,是单纯堆叠单任务数据给不了的。

人类数据的捷径

这正是人类第一人称视频登场的地方。一个人打扫厨房,会生成一条密集的第一人称接触、灵巧操作与意图的数据流,其成本远低于遥操作一台机器人走完同样的动作。Ego4D 汇集了数千小时这样的素材;Ego-Exo4D 又加入了对熟练任务时间同步的第一人称与第三人称视角。整个领域的赌注是:这类数据能廉价地覆盖人类的长尾,而人手与机器人手之间的差距,可以靠合适的重定向,加上一小堆机器人本体数据来锚定,从而被缩小。

这不是免费午餐。人类视频缺少机器人本体感知与干净的动作标签,形态差异也真实存在。但作为买入覆盖度的方式,也就是真正约束机器人性能的那条轴,它每小时的成本远低于任何遥操作台架。

那么,更多数据是否意味着更好的策略?是的,但真正起作用的词不是「更多」,而是「哪些」。语言模型可以对分布偷懒,因为网络早已覆盖了它日后会被问到的大部分内容。机器人没有这份运气。未来几年胜出的团队,不会是轨迹数量最大的那个,而是数据与其机器人被派往的那个杂乱、富含接触、长尾密布的世界最贴合的那个。

scaling-lawsrobot-learningvla-modelstraining-dataegocentric-data

来源