机器人基础模型的数据策展:取舍与加权
决定机器人基础模型泛化能力的是数据策展,而非原始数据量:该保留什么、剔除什么,以及如何为一份训练语料加权。
两支团队从同一个检查点出发。相同的架构,相同的算力预算,相同的一周 GPU 时间。一支团队的策略能够泛化到陌生的厨房,另一支的策略却在杯子挪动两英寸时就手足无措。差别不在模型,而在于每支团队选择用来训练的语料,以及他们各自丢弃了什么。
这是机器人基础模型令人不安的真相。架构正日益同质化,数据配比却不会。数据策展,也就是决定保留什么、剔除什么、以及如何为其余部分加权,才是如今大部分真正的工程发生之处,而它很少出现在演示视频里。
策展听起来像是打扫卫生的活儿,其实更接近于投资组合的构建。你每加入一条轨迹,都会改变模型所相信的那个分布。
更多数据反而让策略变差
一种天真的假设是,机器人语料的表现会像文本语料一样:灌入更多 token,损失就会下降。事实并非如此。机器人数据在构造上就高度不均衡。一支遥操作机队在同一个抓放工位上运行一个月,会产生成千上万条几乎完全相同的抓取,却几乎没有罕见事件。
在这样的原始数据堆上训练,策略会对常见情形过拟合。它会在见过一万次的抓取上表现出色,却在只见过两次的抓取上束手无策。再增加一百万条简单示范并不能修复这种失败,反而会把本可以救场的信号淹没掉。
聚合语料把这种不均衡摆到了明面上。当 Open X-Embodiment 把二十多种机器人的数据汇集到一起时,少数几个数据集主导了 token 数量,而长尾行为则十分稀少。在未经重新加权的原始混合数据上训练单一策略,其表现会一直不理想。结论很直接:配比比总量更重要。
机器人语料不是一个任你堆大的数据堆,而是一个由你塑造的分布;你保留的每一条示范,都是在为模型眼中的“正常”投票。
策展究竟在决定什么
“策展”这个词底下藏着三个决策,而它们的难度并不相同。第一个是保留,第二个是剔除,第三个是加权,也是团队投入最不足的那个。
保留关乎覆盖面。你希望语料能够覆盖部署后的机器人真正会遇到的状态,包括那些别扭的状态:糟糕的光照、杂乱的桌面、半开的抽屉。剔除关乎数据卫生:损坏的时间戳、丢失的力觉通道、操作员中途放弃的示范。加权关乎侧重。两条示范可以都很干净、都值得保留,却理应对梯度产生截然不同的影响。
这三者彼此拉扯。把覆盖面做到极致,就会重新引入噪声;把数据卫生做到极致,又可能丢掉那些凌乱、偏离常态、却能教会策略如何恢复的示范;哪怕在纸面上把配比调得完美,你仍可能饿死某个只是因为采集昂贵才显得稀有的技能。策展是一组权衡,而不是一张清单,每个维度上的正确取值,取决于模型将被要求去做什么。
| 原始数据中的信号 | 决策 | 防范的问题 |
|---|---|---|
| 抓取失败后的罕见恢复 | 保留并上调权重 | 策略偏离分布时的脆弱性 |
| 一万条几乎相同的简单抓取 | 抽样保留,下调权重 | 对常见情形的过拟合 |
| 回合中途丢失的力-力矩通道 | 剔除该回合 | 教出错误接触模型的隐性缺口 |
| 同一条示范的重复回放 | 去重 | 虚增的数据规模、误导性的评测 |
| 占比不足的技能,例如倾倒 | 上调权重或补采 | 在总体指标上看不见的能力缺口 |
加权:无人公布的那根杠杆
对语料重新加权,是现有最廉价的能力杠杆,也是记录最少的。你不需要新硬件,也不需要新示范,你需要的是改变每一片数据各自的权重。
方法从粗糙到精细都有。最粗糙的是按数据集缩放:给任何单一来源设一个上限,使其无法淹没其他来源,这大致就是聚合基准在训练跨具身模型前所做的事。更精细的做法则按技能、按难度、或按一条示范能在多大程度上降低模型误差来加权。构建通用策略的团队,包括 NVIDIA Isaac GR00T 和 Physical Intelligence 背后的团队,都把数据配方当作模型的一等组成部分,而非事后补充。
但这里有个陷阱。上调罕见数据的权重,也会同时放大它的噪声。一条被误标的恢复示范,被计入五次,就会以五倍的响度教出错误的一课。加权与清洗不是两件独立的杂活。要么一起做,要么杠杆就会朝错误的方向发力。
策展的上限取决于你的元数据
上面的每一个决策都假设你能分辨自己的各片数据。你无法上调从未标注过的恢复示范的权重。如果没人记录哪个通道掉了,你也无法剔除掉了通道的回合。策展位于采集的下游,它继承的正是采集管线愿意记录下来的一切。
这就是为什么像 DROID dataset 这样严肃的语料会随每个回合附带丰富的元数据,如场景、具身、相机配置;也是为什么 Toyota Research Institute 构建 large behavior models 的团队会把来源追溯当作数据集的一部分,而非锦上添花。没有这种结构,策展就退化成了在一大团无差别数据上的猜测。
评测继承了你的策展
策展塑造的不只是训练,还有记分牌。如果你的留出测试集同样取自那些占比过高的简单抓取,一个策略可以刷出很高的分数,却依然在现场失败。跨越训练集与测试集泄漏的近似重复示范会让问题更糟,因为模型实际上已经见过了考卷。这正是为什么去重、以及一个刻意设计得更难、以覆盖面为导向的评测集,本身就属于策展,而不是另行处理的事后补充。你所信任的那个数字,其诚实程度不会超过它所来自的那次划分。
配方就是产品
人们很容易把策展当作等有趣的建模工作完成之后再做一次的清理。这把顺序弄反了。对于机器人基础模型,语料及其加权是半衰期最长的产品决策。架构会不断更替,而一份策展得当、记录完善的语料,会在一代又一代模型中持续带来回报。
所以,该问数据供应商的不是他们有多少小时的数据,而是他们如何知道这些数据里有什么、又会剔除什么。如果答不上来,他们卖的就是数量,而不是信号。