拉伸稀缺的示范:面向机器人策略的数据增强
真实机器人示范稀缺,于是团队用数据增强去拉伸它。讲清裁剪、扩散与回放能廉价补上什么,又无法伪造什么。
在图像分类里,一张照片会悄悄变成五十张。翻转它、裁剪它、偏移色相、微调亮度,标签依旧写着「猫」。这个技巧有个名字,叫数据增强(data augmentation),它是视觉模型得以扩展的、被低估的原因之一:训练集免费地变大了。机器人领域也想要这顿免费午餐,而且想得很迫切。单单一条真实的机器人示范,就可能要花上数分钟细致的遥操作,而这类数据长期短缺。
于是团队开始做增强。他们裁剪并重新着色相机画面,用扩散模型把示范合成到新的背景上,往记录下来的轨迹里注入噪声,还把同一段动作渲染成现实中从未存在过的相机视角。做得好,增强能把一条采集到的示范变成许多条,并且切实改善策略应对光照变化或杂乱桌面的能力。这是真实存在的收益,成本又低,每一条严肃的机器人学习流水线都会用上一些。
但增强有一条无法逾越的界线,而看清它究竟画在哪里,正是廉价胜利与悄然失败之间的分野。你可以改变一条示范看上去是什么样,却无法改变它摸上去是什么感觉。一帧被重新着色的画面,仍然带着它一直以来的那份握力;一条被回放的轨迹,复用的是只被测量过一次的接触。增强放大的是感知,它无法凭空造出它从未见过的物理。
视觉增强:廉价而可靠的那份收益
最古老的一族技巧只在图像本身上做文章。随机裁剪、小幅平移、色彩抖动、明暗与对比度变化、高斯模糊:它们都不碰动作标签,却都能让策略对那些恰好会毁掉实验室到现场迁移的干扰因素不再脆弱。Berkeley 关于从像素做强化学习的工作表明,哪怕是随机裁剪这样粗暴的手段,只要一致地施加,也能显著提升基于视觉的策略的样本效率与稳健性,有时足以追平那些用了多得多数据的方法。
更新、更强的版本是生成式的。你不再抖动像素,而是重写场景。扩散式的图像修补(inpainting)可以换掉机器人身后的厨房,放进示范者从未摆过的干扰物,或者把桌面重新打光、仿佛太阳挪了位置,而这一切都不动被操作的物体和手的轨迹。一批近期的机器人学习研究正是用这一手,去制造遥操作装置采样很差的背景与光照多样性。所有视觉方法买到的都是同一样东西:对外观的不变性。而它们谁都没有改变底层的动作或物体的动力学。轨迹一模一样,只是外包装变漂亮了。
轨迹与状态增强:教会恢复
模仿学习有一个结构性弱点。只在干净的专家示范上训练出的策略,只在这些示范到访过的状态上可靠,而机器人一旦哪怕稍稍偏离那条路径,它就从没见过该如何回来。误差随之累积。轨迹增强直接迎击这一点,办法是刻意制造那些偏离路径的状态。
注入噪声是最简单的形式。Berkeley 的 DART 方法在记录时扰动示范者,于是记录下的轨迹会向名义路径周围铺开成一条「管道」,策略便学会对小幅偏差做出纠正动作,而不是死记一条干净的线。DAgger 式的方法更进一步:运行当前策略,收集它实际到访的状态,请专家在那里标出正确动作,再把这些纠正折回训练里。两种技巧都在示范流形附近合成出覆盖度。两者也共享同一条边界:它们拓宽的是你已采集内容周围的管道,却够不到机器人从未进入、专家也从未示范过的那片状态空间。
回放与视角合成:从同一份采集里生出更多示范
第三族技巧成倍地复制整条示范。以 MimicGen 式流水线为代表、如今已并入 NVIDIA Isaac GR00T 合成数据蓝图的基于回放的生成,会取来一小把人类示范,把它们切分成以物体为中心的动作片段,再把这些片段适配到新的物体位姿与布局上加以回放。十几条示范于是变成数百条,每一条都带着精确的动作标签,因为那段动作是被几何地变换出来的,而不是被猜出来的。
视角合成对相机做同样的事。把采集到的场景送进一个神经重建,一个 NeRF 或一团 3D Gaussian splat,你就能从没有任何真实相机占据过的视角生成这条示范,不必再采集一次,就为模型买到视角不变性。两者都很有力,也都继承了同一个假设:记录下来的交互在变换之后依然成立。对刚体的抓取放置来说,这没问题,把盒子挪三十厘米,几乎不改变接触。可一旦物体发生形变、打滑,或者以不同于你真正记录过的那一次交互的方式回抗,这个假设就悄悄崩了。
增强无法伪造什么
上面每一种方法,都是你已经拥有的数据的一个函数。这正是它的全部要点,也是它的天花板。增强无法添加一开始就从未被采集下来的信息。RGB 像素里没有力的读数,所以再怎么重新着色,也造不出那让玻璃杯没有滑落的 3 牛顿握力。换背景改变的是外观,而不是摩擦系数。回放一条抓取刚性盒子的示范,教不会任何关于合上一只柔软袋子的事,因为区分二者的那次接触事件,从来就不在源记录里。
| 技术 | 廉价补上的 | 无法伪造的 |
|---|---|---|
| 裁剪、色彩、明暗抖动 | 相机与光照不变性 | 新几何、物体身份、接触 |
| 扩散背景/图像修补 | 场景、背景、干扰物多样性 | 真实接触力与物体动力学 |
| 注入噪声(DART 式) | 示范路径附近的恢复 | 从未到访路径之外的恢复 |
| DAgger 式纠正 | 已到访状态上的纠正标签 | 没有可用专家动作的状态 |
| 带扰动位姿的回放 | 新的物体摆放、更多轨迹 | 源示范中不存在的接触动力学 |
| 新视角合成 | 未见过的相机视角 | 从未被观测到的遮挡几何 |
这与整个领域关于多样性的认识严丝合缝。Toyota Research Institute 在构建其 Large Behavior Models 时发现,真正改善策略的示范,是那些覆盖了它从未见过的条件的示范。增强覆盖的是那些作为外观之函数的维度:光照、背景、相机角度;它覆盖不了那些作为物理之函数的维度:接触、形变、质量、摩擦,以及一次真正全新的物体交互。这些,只对一个在真实的手做真实任务时就在场的传感器可见。
增强放大的是你已经采集到的东西。它无法记录一份你从未测量过的力,或一次你从未做过的接触。那些,你还得亲自去触碰。
如何花掉增强预算
把增强当作一份预算、而不是一个开关,选择就变得一目了然。有几条法则在不同团队之间都站得住脚:
- 放手去增强外观。裁剪、色彩以及生成式的背景替换几乎是免费的,又正好迎击实验室到现场性能回退最常见的成因。在这里没什么理由抠门。
- 用轨迹增强去教会恢复,而不是去发明技能。注入噪声与纠正性重标注的价值,恰恰落在示范路径附近,那里偏移很小,正确动作也可知。
- 用回放与视角合成去换取刚体任务的几何覆盖度。当接触简单、假设成立时,它们是极好的乘数;当假设不成立时,它们会误导。
- 把真实采集花在接触、力和全新的物体交互上。这些恰恰是任何变换都合成不出来的,所以这里正是昂贵的、与具身对应的多模态数据挣回成本之处。DROID 这样的项目之所以存在,正因为这种采集确实很难;增强只能降低你需要的采集量,却永远无法把它降到零。
这一切都不是在反对增强,而是在主张:要弄清它到底解决了你两个问题里的哪一个。如果一个策略因为光变了而失败,那就增强,修起来很便宜。如果它是因为遇到了一份从未被展示过的力而失败,那么再多的裁剪、再多的重绘、再多的回放,都救不了它。那次失败,是在采集的当下、在物理世界里,由「当时有没有一个传感器在场去感受它」所决定的。