Compute vs data:机器人学的瓶颈究竟在哪里
为什么具身智能的扩展遇到了数据墙,而非 GPU 墙?本文深入探讨行业如何解决示教数据危机。
100瓦的悖论
一块 H100 GPU 在满载运行时的功耗高达 700 瓦。而人类大脑在控制双手穿针引线时,功耗仅为 20 瓦左右。如果具身智能革命仅仅是一个 compute vs data 的简单问题,那么前行的道路将非常直接:堆叠更多芯片、扩大集群规模,然后静待涌现的推理能力去解决物理世界的问题。然而,训练一个 humanoid 机器人去折叠衬衫,与训练大语言模型写 Python 代码有着本质的不同。
我们已经走到了一个拐点,在这个拐点上,机器人领域的 compute vs data 之争已被物理现实尘埃落定。当前沿 AI 实验室运行庞大集群来训练下一代多模态模型时,具身智能的开发者们却撞上了另一堵墙。我们并不缺少在 100 亿参数的 Vision-Language-Action (VLA) 模型上进行推理的张量核心(tensor cores),我们缺少的是将这些模型牢牢锚定在充满混沌与非线性动力学的真实世界中所需的高质量、高频率、多模态物理示教数据。
humanoid 机器人领域的 bottleneck 不是算力预算,而是物理数据层。
物理扩展的数学逻辑
要理解这一瓶颈为何存在,我们必须审视现代机器人基座模型对数据的严苛要求。大语言模型是在从互联网上抓取的数万亿 token 上进行训练的,文本数据廉价、静态且丰富。而具身智能模型,例如 Physical Intelligence 在其通用机器人策略研究中所讨论的,则需要连续的轨迹数据,这些数据必须将高分辨率的视觉输入与精准的力、扭矩以及本体感受电机动作完美配对。
| 领域 | 主要数据源 | 典型采样率 | 每秒数据密度 | 获取难度 |
|---|---|---|---|---|
| 文本 (LLM) | 网页抓取、书籍 | 静态 | 因词而异 | 极丰富 (数万亿 token) |
| 视频 (生成式) | 网络视频、电影 | 24-60 Hz | 兆字节级 (仅像素) | 高 (数 PB 视频) |
| 机器人 (VLA) | 物理示教数据 | 30-240 Hz | 兆字节级 (像素、关节角度、扭矩) | 极度匮乏 (仅数千小时) |
在数据采集设施中捕获的一个典型人类示教流程,需要以每秒 30 到 60 帧的速度记录多角度 RGB 视频,并与 100 Hz 到 240 Hz 的机器人关节位置、速度及触觉反馈保持纳秒级同步。当我们审视像 Open X-Embodiment 或 DROID dataset 这样的主流开源数据集时,会发现它们虽然多元,但依然高度碎片化。尽管这些数据集是具有里程碑意义的成果,但与推动 GPT-2 向 GPT-4 跨越的数据量相比,它们只是沧海一粟。
具身智能最无情的事实在于,仅靠模拟数据无法弥合鸿沟:高保真的人类示教数据依然是实现真实世界泛化能力的唯一真理。
为什么仿真不是万灵药
一个常见的反驳观点是,我们可以通过在虚拟仿真环境中训练机器人来绕过物理数据的瓶颈。像 NVIDIA Isaac GR00T 这样的平台已经证明,在仿真中通过强化学习教机器人进行基本步态和控制策略具有极高效率。然而,仿真技术始终受制于“sim-to-real”(仿真向真实世界迁移)的鸿沟。
尽管物理引擎可以高精度地模拟刚体动力学,但面对接触力学、柔性体、流体动力学以及光学噪声的无限复杂性时,它们依然捉襟见肘。一个完全在仿真中训练去抓取塑料瓶的机器人,在现实世界中可能会遭遇失败,因为它无法准确预测塑料瓶在指尖压力下的形变,也无法预估瓶内液体晃动带来的重心偏移。为了跨越这一鸿沟,模型必须在真实世界的 egocentric 数据上进行微调或预训练,例如 Ego4D 和 Ego-Exo4D 数据集中的多模态轨迹。
动作空间的维度灾难
在语言模型中,动作空间是离散的:模型只需从大约 10 万个单词的固定词表中选择下一个 token。而在物理操作中,动作空间是连续且多维的。一个拥有双臂、双手和躯干的 humanoid 机器人拥有数十个自由度。在每一毫秒内,控制器都必须为每一个执行器输出精准的扭矩值。任何一个关节的微小偏差都会在运动链中累积放大,从而改变系统的整个物理状态。
向端到端 VLA 模型的转向
这种复杂性解释了为什么整个行业正在告别传统的、手写代码的控制循环,转向端到端学习。这一趋势在 1X Technologies 和 Skild AI 等公司的探索中显而易见,他们正在构建能够将感官输入直接映射到电机输出的通用物理智能体。
当这些模型被注入海量的人类示教数据时,表现最为出色。人类拥有直觉物理学:我们本能地知道用多大力量去拉开卡住的抽屉,如何接住掉落的物体,以及如何在湿滑的地面上保持平衡。通过第一人称多模态遥操作或穿戴式采集系统捕获这些内隐知识,是目前唯一能够冷启动通用机器人系统的已知途径。
通往物理扩展之路
如果我们希望机器人能够安全地在医院、仓库和家庭中运行,我们就必须像规划 GPU 集群那样,以同样的工程严谨性来对待物理数据的采集。瓶颈已不再是神经网络的推理速度,而是训练数据的规模、多样性与保真度。唯有构建专业的物理基础设施来捕捉人类触觉与动作的丰富细节,具身智能才能从实验室演示走向可靠的实际部署。