为什么第一人称人类视频是最便宜的机器人数据之一

第一人称人类视频把机器人移出采集环路,于是小时数很便宜。本文讲它为何能这样扩展,以及那道让它保持诚实的本体差距代价。

阅读约 7 分钟

DROID 是近几年被引用最多的机器人操作数据集之一,13 家机构横跨三大洲,花了将近一年才把它攒出来。成果是大约 350 小时的遥操作轨迹,每一条都在真实机械臂上、由人手动控制录制。Ego4D 是一个让人戴着头戴相机、记录寻常一天的数据集,规模约 3,670 小时,主要靠把相机发给志愿者、请他们照常生活采集而来。两个数字相差十倍,而更大的那个并不需要机器人。

这个对比几乎就是第一人称人类视频作为机器人训练数据的全部论据,而且是个有力的论据。一条机器人演示里最贵的原料,就是机器人本身。把它从采集环节里拿掉,改为记录一个人从自己视角完成任务,经济学就从机器人机队的账本,切换成消费级视频的账本。你不再为机械臂、工作单元、安全围栏和操作员工时付费,转而为相机和存储付费。

但让数据变便宜的同一步动作,也带来了那个让整件事保持诚实的代价。本文关心的是两半:为什么第一人称人类视频是你能喂给操作策略的最便宜数据之一,以及如果只读到这里,"每小时便宜"为什么是个错误的计量单位。

机器人才是贵的那部分

遥操作至今仍是机器人数据的黄金标准,因为它的标签是诚实的:人直接驱动真实机器,于是每一帧都自带策略需要预测的精确关节指令。问题在于产能。每条轨迹都要占用一台机器人、一名操作员、一个工作单元,时长等于任务本身再加上每次拍摄之间的复位时间。接触密集的数据集把成本推得更高。RH20T 采集了约 110,000 条操作序列,带有同步的力·力矩、音频与多视角视觉,而这每一条都在真实硬件上完成,那些硬件要采购、安装、标定,并在每次拍摄之间复位。

汇集能缓解问题,却改变不了单位成本。Open X-Embodiment 把 20 多家机构、22 种机器人本体的一百多万条真实机器人轨迹拼在一起,它至今仍是这个领域最有价值的资产之一,正因为这么多真实机器人数据实在太难产出。投资人有时会忽略:这种稀缺是结构性的。机器人轨迹不会躺在互联网上等着被抓取,每一条都必须在一台机器上、实时地被生产出来。

第一人称视频按消费级视频的方式扩展

现在把机器人拿掉。一个人本就拥有市面上最好的机械手:两只带触觉反馈、经过数十年训练的手,而且他们乐意在戴着相机的情况下叠衣服、切菜、接插头。从他们的眼睛和手腕采集这个世界,你就得到了机器人策略想要的那种第一人称、接触密集的画面,却一台机器人都不必拥有。

随之而来的规模是另一个量级。Ego4D 从 9 个国家、900 多名参与者那里采到了约 3,670 小时。Ego-Exo4D 又补上约 1,300 小时成对的第一人称与第三人称技能活动录像,由十几个城市里数百名参与者采集。这两个数字都不受机器人机队限制,受限的是你能把设备发给多少人,这是个物流问题,而不是硬件制造问题。相机翻倍,数据大致也翻倍。换成遥操作试试,你翻的是机械臂。

每种数据源真正的成本

每小时的标价只是故事的一半。另一半是每小时究竟携带多少可用的训练信号。下表把主要的操作数据源,按成本驱动因素与缺失项排在一起。

各类操作数据源在扩展成本、硬瓶颈与策略仍需补足项上的对比
数据源扩展它的成本硬瓶颈策略仍缺的东西
真实机器人遥操作(DROID、RH20T)每小时数据约等于一台机器人一小时,外加操作员机器人机队规模几乎不缺;标签是原生且诚实的
被动第一人称视频(Ego4D)相机与存储;无需机器人愿意佩戴的人与知情同意动作标签、深度、力、机器人坐标系下的本体感觉
带传感的第一人称采集(Ego-Exo4D 类)相机装置外加深度、手部姿态,有时含力装置成本与参与者时间机器人形态与原生动作标签
仿真工程时间;复制成本低仿真到现实的差距真实接触动力学与真实世界的杂乱多样性

代价所在:小时便宜,标签昂贵

读一读那张表的最右列,折扣自己就现身了。一个操作策略,归根结底是在回归一个动作:给定这个画面和这条指令,输出下一个电机指令。遥操作直接记录了这个指令。被动第一人称视频则根本没记录它。你拍下的是一只手在动,而不是驱动它的力矩,而再高的分辨率也还原不了一个从未被采集的信号。

便宜的画面与训练好的策略之间,横着三道沟。第一是本体差距:五指人手不是两指夹爪,把前者重定向到后者是有损的,而且恰恰在接触发生的那一刻损失最大。第二是标签差距:手部与手指姿态必须从像素里估计,再转换成机器人能执行的东西,每一个估计器都在累加误差。第三是模态差距:随手拍的第一人称视频没有深度、没有力·力矩、没有触觉痕迹,而正是这些通道,把一次稳握和一颗被捏碎的鸡蛋区分开来。

第一人称视频按小时算便宜,按标签算昂贵。把机器人从采集里拿掉,它会以星号的形式回到每一条轨迹上:缺失的动作、错误的手、没人测量的力。

因此,给这类数据定价的诚实方式,不是每小时多少钱,而是每单位可迁移信号多少钱;按这个尺度,第一人称视频是便宜,而不是免费。两种价格之间的差额是实打实的工作:姿态估计、重定向、标定与质量控制。账单不会消失,它只是从装卸月台,挪到了研究团队。

这个领域如何弥合差距

富有成效的做法不是选边,而是把数据源组合起来。主流配方是用一大批廉价的人类视频,配上一小批真实机器人遥操作做锚点,再让模型自己学出什么能迁移。NVIDIA Isaac GR00T 把人类第一人称视频当作其数据配比的一根支柱,与仿真以及相对少量的真实机器人演示并列,并用习得的潜在动作让无标签视频变得可用。跨本体训练,也就是 Open X-Embodiment 背后的思路,在机器人种类之间做着类似的事:把一切汇集起来,让共享结构自行浮现,不再把每一种形态当成孤岛。

有两个工程动作让人类那一半真正出力。重定向把估计出的人手轨迹映射到机器人的运动学上,让廉价数据说机器人的语言。协同训练则在损失函数里保留一小批诚实的机上轨迹,把策略锚定在真实动作标签与真实动力学上。Physical Intelligence 和开源的 LeRobot 社区都在向这一模式的各种变体收敛,这也是为什么那个有意思的问题已经悄悄转向。它不再是人类视频有没有帮助,而是你能多便宜地把它连同那些让它值得训练的额外通道一起采集下来。

所以,第一人称人类视频确实属于最便宜的机器人数据之列,但"便宜"说的是装卸月台,而不是整条流水线。小时便宜,是因为环路里没有机器人。训练好的策略并不免费,因为你拿掉的那台机器人会以工程的形式回来:姿态估计、重定向,以及一小批用来让模型保持诚实的真实轨迹。只读第一个数字,你就会在第二个数字上多付钱。定价正确的话,第一人称视频不是绕开机器人数据的捷径,而是买下其中大部分的最便宜方式,前提是你为相机从未看见的那部分留出预算。

cheap-robot-dataegocentric-videodata-scalepolicy-learningembodiment-gap

来源