具身智能的数据瓶颈

算力和模型架构都已就位,真正卡住具身智能的是真实世界的数据。深入这道数据瓶颈,以及它背后的数据金字塔。

阅读约 6 分钟

GPT 这一类语言模型,训练所用的语料几乎接近整个公开网络:数以万亿计的词,是数十亿人早已出于自己的目的写下、并顺手留在那里的。机器人领域很想要一份对等的东西,可它没有。世界上并不存在一个巨大的语料库,记录着机器人拿起杯子一千万次,也没有任何网络爬虫能去把它造出来。

这是很多具身智能(embodied AI)热潮背后一个不太被提起的事实。模型是好的。算力是有的。以 2026 年的标准看,配方也算相当清楚了。缺的是燃料:身体执行物理任务的真实世界数据,其数量和质量要达到当年让语言模型奏效的水平。数据才是那个约束性瓶颈,而它为什么是瓶颈,值得说清楚。

算力和架构不再是那堵墙

几年前你还可以怪模型。现在基本不能了。具身控制的主流设计,即视觉·语言·动作(VLA)模型,是一个吃进像素和指令、吐出动作的 transformer,它和已经在文本与图像上被验证过的架构长得很像。Open X-Embodiment 表明,一个在多种机器人类型上联合训练出来的策略,胜过在每一种上单独训练的策略。NVIDIA Isaac GR00T 和丰田研究院的 Large Behavior Models,就架构而言并不奇特。它们只是很能吃。

给这类模型喂进更多好数据,它就会以我们在语言模型上见过的那种平滑、可预期的方式变强。这既是令人鼓舞的一面,也同时是令人沮丧的一面。杠杆是有效的,可这根杠杆需要我们并不拥有的数据。

为什么语言模型占了便宜

文本是人类思考的废气。我们不停地生产它,出于自己的目的,而且它早已数字化。训练一个语言模型,等于去收割一种本来就存在的副产品。物理动作却不留下这样的痕迹。当你清空洗碗机时,没有任何文件被写下。你手腕的关节角度、手指里的力、你选择先抓哪个的顺序,全都在你做完的那一刻蒸发了。

算力随资本扩展,架构在很大程度上是一份共享的配方。唯一无法从货架上买到的输入,是上百万小时真实的手在做真实任务。

所以具身智能没法靠抓取数据来堆出一个基础模型。它必须把训练集生产出来,一个动作一个动作地生产,而这彻底改变了其中的经济账。

数据金字塔

把握这个问题的一个好办法,是想象一座金字塔:底部最宽也最廉价,顶部最窄也最有价值。每一层都在「丰度」和「对真实机器人的保真度」之间做权衡。

具身智能的数据金字塔:越往上爬,丰度越低,保真度越高
层级来源丰度对机器人的保真度每有效小时的大致成本
底层网络文本与图像几乎无限低:只有语义,没有动作接近于零
底层互联网人类视频非常大低到中:能看到任务,没有动作或力的标签
中层仿真大,可按需生成中:物理是近似的,sim-to-real 差距明显低,另加工程投入
顶层遥操作机器人演示高:真实机器人、真实接触
顶层专门采集的人类演示小但在增长高:真实的手、多模态、需要重定向中到高

大多数认真的流水线会用上整座金字塔。你在底层做预训练,获得宽广的视觉与语义先验;在中层用仿真把数据量灌大;再把稀缺的预算花在顶层,那里的数据才真正像一台机器人在与世界发生接触。争夺集中在顶层。策略在那里变得可靠,而那也是昂贵的部分。

各层之间的配比,比它看上去更要紧。一个策略可以吞下海量廉价的底层数据,却仍然过不了最后一公里,除非有几百段针对该任务、在该硬件上采集的高保真演示。廉价数据定的是先验,昂贵数据定的是行为。配比错了,两头都白费。

遥操作昂贵,人类视频便宜而粗糙

填充金字塔顶部有两条路,问题正好相反。

遥操作让人在回路里直接驾驶真实的机器人,于是每一段记录都带着机器人自身动作和传感器的完美标签。就保真度而言,它是黄金标准。它也慢、也贵:一个操作员、一台机器人、大致实时、一次一个任务。DROID 以及社区合力采集的数据集,是靠跨众多机构数月的协调才做大的,而它们放在网络语料旁边依然渺小。

人类视频把这笔权衡反了过来。人快、便宜、又灵巧,生成演示的速度远快于任何一台遥操作机器人。但原始人类视频不带动作标签,不记录力,画面里还是一只需要被重定向到不同末端执行器上的人手。它采集起来更便宜,处理起来却更贵。那份处理,即提取手部姿态、还原轨迹、补上视频所缺的传感通道,才是真正的工作量。

两条路都不是捷径。遥操作用你无法压缩的时间换来保真度,人类视频用一笔留到后面才付的处理账单换来体量。真正在推进的团队,把两者都当成需要工程化的供应链,而不是下载一次就完事的数据集。

正因如此,采集正在成为一门专门的功夫

这个领域正在形成的共识是:你既没法整批买到这类数据,也没法把它完全伪造出来。Google DeepMind 等团队都依赖过大规模、精心采集的真实世界演示集,而它们一次次撞上同一堵墙:你投入多少,大致就得到多少,而投入的过程是人力密集的。像 RH20T 这样的数据集之所以存在,是因为有人决定带着传感器、有意识地、成规模地去采集富接触的操作。

这一切并不意味着模型工作不重要,它只是重新界定了模型工作。具身智能里有意思的问题,正在从我们能否设计出学会灵巧任务的策略,转向我们能否生产出足够多、足够对的数据去喂它。第一个问题已接近有答案。第二个问题是一个披着研究外衣的物流问题,而它才是决定机器人究竟多快真正变好的那一个。

data-bottleneckembodied-aiphysical-aitrends

来源