遥操作 vs 人类视频:通往机器人数据的两条路
遥操作给出与机器人完全对齐的示范,代价高昂;人类视频提供廉价的规模,却需要你去重定向。一份关于两种数据供给取舍的对比。
给两者都掐个表。一位熟练的遥操作员戴着 VR 设备,一个小时或许能录下机器人叠几十次毛巾,而每一次重复都要耗掉一台机器人、一位操作员和一处受控的工作空间。同样这一个小时里,一位大厨头戴摄像头,能拍下上百次抓取、倾倒和擦拭,成本不过一张存储卡。一条数据流稀缺,却恰好为训练量身而成;另一条几乎免费,却略有偏差。整个故事就藏在这道错位里。
两者都是对同一种饥渴的回应。模仿学习需要示范,而物理世界几乎不免费提供任何示范,于是长出了两条供给线来喂它。遥操作把人放进机器人自身的回路里,通过主从机械臂、VR 手柄或外骨骼,在人驱动机器人的同时记录下机器人自己的传感器与指令。人类视频学习则完全跳过机器人,以第一人称记录人们做日常任务的过程,再设法把这些画面转化成策略能够学习的东西。
它们之间诚实的区别,不在于抽象意义上的"质量",而在于动作标签从何而来,以及由谁来付出代价把它与机器人对齐。遥操作把这份对齐预先买下,单位成本高得吓人。人类视频则预先买下规模,把对齐这笔账推迟给算法去还。这篇文章要看的,是你更愿意付哪一张账单,以及为什么最好的机器人团队正悄悄拒绝二选一。
动作标签落在哪里
先说清那个一切都悬于其上的事实。在遥操作里,机器人就是执行者,于是每一帧都与产生下一帧的精确关节指令和夹爪状态成对出现,且落在机器人自己的动作空间里。搭起有监督的模仿学习几乎不费力:预测被记录下来的动作即可。人类视频给你的恰恰相反。你能极其细致地看到意图与结果,但那个"动作"是一只有着二十多个自由度的人手,在无人测量的接触力下运动。要用它,你必须重建一个机器人真能执行的动作:估计手部位姿,把它重定向到夹爪,再推断你从未感知过的接触。机器人学界把这称作对应问题(correspondence problem)。遥操作靠构造就解决了它。人类视频把它甩给你,而下面每一项取舍,都是这件事的下游。
遥操作这本账
遥操作给你的,是机器人学习中最干净的信号:数据取自你将要部署的那台机器本身,带着本体感知、有时序的动作标签,往往还有被动视频永远无法还原的力矩与触觉通道。DROID 采集了约 76,000 条遥操作轨迹、大约 350 小时,覆盖数百个场景、来自多家机构,它标示出规模化遥操作大致长什么样。RH20T 更进一步深入接触密集的一端,超过 100,000 条序列,在视觉之外还带着力矩与音频。而由于没有哪一家实验室能从零开始负担得起,Open X-Embodiment 把二十多种机器人的遥操作数据汇聚成一个约百万条轨迹的语料库。
- 落在机器人自身空间里、逐帧对齐的动作标签
- 本体感知,以及在更完备的装置上,力矩与触觉信号
- 与控制回路而非观众移动镜头相匹配的时序
账单在吞吐量上到期。一位操作员驱动一台机器人一个小时,产出一个"机器人小时"的数据,没有任何倍增器。硬件会磨损,工作空间需要有人看管,场景也只是实验室里能摆下的那些,于是真实世界变化的长尾,恰恰是遥操作最不擅长覆盖的部分。它是这个领域保真度最高的示范数据,也是最难扩规模的。
人类视频这本账
人类视频在遥操作够不到的两个维度上取胜:规模与多样性。Ego4D 收集了约 3,600 小时的第一人称日常活动视频,横跨众多国家与场景。Ego-Exo4D 走得更远,用成对的第一人称与第三人称摄像头拍摄有技巧的人类活动,配上专家解说与技能标注,时长远超一千小时,专为让机器学习人如何把事情做好而建。相比遥操作那一小桶,这是一片海洋,而它增长的代价不过是几台摄像头。
代价,是遥操作原本免费拥有的一切。没有机器人,就没有原生的动作标签;没有力的感知;一只五指手与一个平行夹爪之间横着一道形态学鸿沟;视角随人头飘移,而非固定在受控的手腕上。所以人类视频大多从侧门进入训练:作为视觉-语言表征、可供性(affordance)与世界模型先验的预训练,并越来越多地作为从手部位姿还原出的重定向伪动作。NVIDIA GEAR 实验室关于从人类视频学习、并合成神经轨迹的工作,就是这里一条活跃的路线。这一注押的是:一座廉价的、错误具身的数据大山,加上一点点正确具身的数据,胜过其中任何一者单打独斗。
遥操作花钱买对齐,却把规模配给着用。人类视频花钱买规模,却仍欠着你那份对齐。两条路都不免费;它们只是把账单寄往了不同的地方。
两本账,并排来看
| 维度 | 遥操作 | 人类视频 |
|---|---|---|
| 谁在行动 | 机器人,由人驱动 | 人,现场没有机器人 |
| 动作标签 | 原生,落在机器人空间里 | 缺失,必须重建 |
| 具身匹配 | 精确 | 有待跨越的形态学鸿沟 |
| 力与本体感知 | 通常有采集 | 未采集 |
| 每可用小时的成本 | 高,一操作员小时换一机器人小时 | 低,只算摄像头时间 |
| 规模与多样性 | 狭窄,受限于实验室 | 广阔,来自真实世界 |
| 当下主要角色 | 微调与部署数据 | 预训练与先验 |
| 主要风险 | 无法扩到长尾 | 对应与重定向误差 |
把它读成两张账单,而不是一份排名。每条路都靠为另一样东西付出高价,来廉价地买下这一样。
两条路正在收拢
如今最有意思的工程,恰恰活在两者之间。手持夹爪装置,一只真实的平行夹爪握在人手里、配上腕部摄像头,让人能采集到本就录在机器人动作空间里的"人类视频",在保住人类速度、真实世界采集的同时,把对应问题大半消解掉。外骨骼与被牵引(puppeted)的装置从另一侧追逐同一个把戏。与此同时,整个领域的默认配方已经沉淀为一个次序:先在人类视频上预训练感知与先验,再在遥操作上微调,把确切的具身锁定下来。跨具身汇聚,也就是 Open X-Embodiment 背后的那股本能,叠在这两者之上。眼下活着的问题,不再是"走哪条路",而是"按什么比例混合,以及把你稀缺的遥操作小时花在哪里"。
所以别问哪种数据更好。问你缺的是什么。缺对齐,就去遥操作,用操作员小时来付账。缺规模,就去拍人,用重定向来付账。多数团队两样都缺,这正是为什么最锋利的工作已经转向两条路之间的汇率,也是为什么示范的短缺,会比迄今发布的每一个数据集都活得更久。