遥操作 vs 人类视频:通往机器人数据的两条路

遥操作给出与机器人完全对齐的示范,代价高昂;人类视频提供廉价的规模,却需要你去重定向。一份关于两种数据供给取舍的对比。

阅读约 7 分钟

给两者都掐个表。一位熟练的遥操作员戴着 VR 设备,一个小时或许能录下机器人叠几十次毛巾,而每一次重复都要耗掉一台机器人、一位操作员和一处受控的工作空间。同样这一个小时里,一位大厨头戴摄像头,能拍下上百次抓取、倾倒和擦拭,成本不过一张存储卡。一条数据流稀缺,却恰好为训练量身而成;另一条几乎免费,却略有偏差。整个故事就藏在这道错位里。

两者都是对同一种饥渴的回应。模仿学习需要示范,而物理世界几乎不免费提供任何示范,于是长出了两条供给线来喂它。遥操作把人放进机器人自身的回路里,通过主从机械臂、VR 手柄或外骨骼,在人驱动机器人的同时记录下机器人自己的传感器与指令。人类视频学习则完全跳过机器人,以第一人称记录人们做日常任务的过程,再设法把这些画面转化成策略能够学习的东西。

它们之间诚实的区别,不在于抽象意义上的"质量",而在于动作标签从何而来,以及由谁来付出代价把它与机器人对齐。遥操作把这份对齐预先买下,单位成本高得吓人。人类视频则预先买下规模,把对齐这笔账推迟给算法去还。这篇文章要看的,是你更愿意付哪一张账单,以及为什么最好的机器人团队正悄悄拒绝二选一。

动作标签落在哪里

先说清那个一切都悬于其上的事实。在遥操作里,机器人就是执行者,于是每一帧都与产生下一帧的精确关节指令和夹爪状态成对出现,且落在机器人自己的动作空间里。搭起有监督的模仿学习几乎不费力:预测被记录下来的动作即可。人类视频给你的恰恰相反。你能极其细致地看到意图与结果,但那个"动作"是一只有着二十多个自由度的人手,在无人测量的接触力下运动。要用它,你必须重建一个机器人真能执行的动作:估计手部位姿,把它重定向到夹爪,再推断你从未感知过的接触。机器人学界把这称作对应问题(correspondence problem)。遥操作靠构造就解决了它。人类视频把它甩给你,而下面每一项取舍,都是这件事的下游。

遥操作这本账

遥操作给你的,是机器人学习中最干净的信号:数据取自你将要部署的那台机器本身,带着本体感知、有时序的动作标签,往往还有被动视频永远无法还原的力矩与触觉通道。DROID 采集了约 76,000 条遥操作轨迹、大约 350 小时,覆盖数百个场景、来自多家机构,它标示出规模化遥操作大致长什么样。RH20T 更进一步深入接触密集的一端,超过 100,000 条序列,在视觉之外还带着力矩与音频。而由于没有哪一家实验室能从零开始负担得起,Open X-Embodiment 把二十多种机器人的遥操作数据汇聚成一个约百万条轨迹的语料库。

  • 落在机器人自身空间里、逐帧对齐的动作标签
  • 本体感知,以及在更完备的装置上,力矩与触觉信号
  • 与控制回路而非观众移动镜头相匹配的时序

账单在吞吐量上到期。一位操作员驱动一台机器人一个小时,产出一个"机器人小时"的数据,没有任何倍增器。硬件会磨损,工作空间需要有人看管,场景也只是实验室里能摆下的那些,于是真实世界变化的长尾,恰恰是遥操作最不擅长覆盖的部分。它是这个领域保真度最高的示范数据,也是最难扩规模的。

人类视频这本账

人类视频在遥操作够不到的两个维度上取胜:规模与多样性。Ego4D 收集了约 3,600 小时的第一人称日常活动视频,横跨众多国家与场景。Ego-Exo4D 走得更远,用成对的第一人称与第三人称摄像头拍摄有技巧的人类活动,配上专家解说与技能标注,时长远超一千小时,专为让机器学习人如何把事情做好而建。相比遥操作那一小桶,这是一片海洋,而它增长的代价不过是几台摄像头。

代价,是遥操作原本免费拥有的一切。没有机器人,就没有原生的动作标签;没有力的感知;一只五指手与一个平行夹爪之间横着一道形态学鸿沟;视角随人头飘移,而非固定在受控的手腕上。所以人类视频大多从侧门进入训练:作为视觉-语言表征、可供性(affordance)与世界模型先验的预训练,并越来越多地作为从手部位姿还原出的重定向伪动作。NVIDIA GEAR 实验室关于从人类视频学习、并合成神经轨迹的工作,就是这里一条活跃的路线。这一注押的是:一座廉价的、错误具身的数据大山,加上一点点正确具身的数据,胜过其中任何一者单打独斗。

遥操作花钱买对齐,却把规模配给着用。人类视频花钱买规模,却仍欠着你那份对齐。两条路都不免费;它们只是把账单寄往了不同的地方。

两本账,并排来看

遥操作与人类视频,作为机器人示范的两条供给线
维度 遥操作 人类视频
谁在行动 机器人,由人驱动 人,现场没有机器人
动作标签 原生,落在机器人空间里 缺失,必须重建
具身匹配 精确 有待跨越的形态学鸿沟
力与本体感知 通常有采集 未采集
每可用小时的成本 高,一操作员小时换一机器人小时 低,只算摄像头时间
规模与多样性 狭窄,受限于实验室 广阔,来自真实世界
当下主要角色 微调与部署数据 预训练与先验
主要风险 无法扩到长尾 对应与重定向误差

把它读成两张账单,而不是一份排名。每条路都靠为另一样东西付出高价,来廉价地买下这一样。

两条路正在收拢

如今最有意思的工程,恰恰活在两者之间。手持夹爪装置,一只真实的平行夹爪握在人手里、配上腕部摄像头,让人能采集到本就录在机器人动作空间里的"人类视频",在保住人类速度、真实世界采集的同时,把对应问题大半消解掉。外骨骼与被牵引(puppeted)的装置从另一侧追逐同一个把戏。与此同时,整个领域的默认配方已经沉淀为一个次序:先在人类视频上预训练感知与先验,再在遥操作上微调,把确切的具身锁定下来。跨具身汇聚,也就是 Open X-Embodiment 背后的那股本能,叠在这两者之上。眼下活着的问题,不再是"走哪条路",而是"按什么比例混合,以及把你稀缺的遥操作小时花在哪里"。

所以别问哪种数据更好。问你缺的是什么。缺对齐,就去遥操作,用操作员小时来付账。缺规模,就去拍人,用重定向来付账。多数团队两样都缺,这正是为什么最锋利的工作已经转向两条路之间的汇率,也是为什么示范的短缺,会比迄今发布的每一个数据集都活得更久。

teleoperationhuman-videoegocentric-dataimitation-learningcomparisons

来源