GR00T、pi0 与 LeRobot:三种数据策略
NVIDIA GR00T、Physical Intelligence pi0 与 Hugging Face LeRobot 用三种方式应对机器人数据短缺。一份关于架构与数据策略的对比,不评高下。
三个团队,一句他们都会签字认可的话:机器人应当从数据里学习通用技能,而不是靠成千上万行手写脚本。可一旦问起这些数据从哪来,共识就瓦解了。NVIDIA、Physical Intelligence 和 Hugging Face 各下了一注不同的赌,而这些赌注比任何跑分榜都更能说明这个领域的现状。
三者都在构建视觉-语言-动作模型(VLA),也就是把摄像头画面和一句自然语言指令转化为机器人动作的那类策略。真正把它们区分开的是供给线:在物理世界几乎不免费提供任何示范的情况下,它们各自如何拿到足够多的示范来训练。这是一份关于三种数据策略的对比。它不是排名,并且刻意不评出赢家。
GR00T:把数据造出来
NVIDIA 的答案带着一家硬件公司的本能:如果数据不存在,那就建一座生产它的工厂。Isaac GR00T 是一个面向人形机器人的基础模型,围绕它的策略重度依赖仿真。一小堆真实的人类与遥操作示范,在物理仿真器里被放大成一个大得多的合成轨迹集合,其中光照、物体位置和纹理都做了随机化,好让训练出来的策略不至于只贴合某一个干净的实验室。
GEAR 实验室推进的流水线,能通过生成式与仿真工具把少量采集到的动作扩成多得多的数据。吸引力显而易见。合成数据便宜、易于成倍复制、采集起来安全,而且可以被完美标注,因为仿真器本就知道每个物体的精确位姿。始终存在的风险是仿真到现实(sim-to-real)的鸿沟:一个策略可能在一个渲染与行为都略有偏差的世界里练得炉火纯青,然后遇上真实的夹爪和真实的抹布,才狠狠地领教到差别。
pi0:把不同的身体汇到一起
Physical Intelligence 下了另一个注:从许多种机器人身上收集真实示范,并训练一个跨越它们全部的策略。pi0 及其后继 pi0.5 是跨具身(cross-embodiment)模型,喂给它的是来自一系列不同手臂和手的遥操作数据,而非某一个标准化平台。其设想是,灵巧操作具有共通的结构,因此一个见过足够多不同身体的策略,会习得可迁移的习惯,而不是死记某一台机器。
在架构上,pi0 值得一提的是它生成动作的方式。它并不逐个吐出离散的动作 token,而是用一个流匹配(flow-matching)动作头,一种借自现代图像生成的技术,来产出平滑、高频的连续运动。这比一串缓慢的 token 更契合操控真实的节奏。这一策略的代价与 GR00T 恰好相反:真实遥操作数据昂贵且采集缓慢,因为它的每一个小时,都是一个人在真机上操作的一个小时。像 DROID 这样的社区努力,既显示了大规模采集遥操作数据的价值,也显示了其中纯粹的人力投入。
LeRobot:把公共资源开放出来
Hugging Face 的 LeRobot 不是某一个模型,也不是某一个数据集。它是一个生态:一个共享库、一套标准数据格式、多种模型实现,以及一个任何人都能发布和拉取机器人数据的公共 hub。这里下的注是社会性的,而非技术性的。如果采集操控数据才是瓶颈,那么绕过它最快的办法,也许就是让分享变得毫无摩擦,让一个社区去积累任何单一实验室都攒不出的量。
LeRobotDataset 格式的意义比听起来更大。一套共同的模式(schema)意味着,在一个国家用一条两百美元的手臂录下的记录,可以不经转换,就与另一大洲某个研究实验室的记录并排加载。LeRobot 还托管了来自整个领域的开放策略实现,包括 pi0 一脉的流匹配模型,这就把那条整齐的对立线模糊掉了:开放的公共资源,某种程度上正是其他路线得以被分发和复现的地方。
三个赌注,并排来看
| 维度 | Isaac GR00T | pi0 / pi0.5 | LeRobot |
|---|---|---|---|
| 出身 | NVIDIA | Physical Intelligence | Hugging Face |
| 核心赌注 | 在仿真中制造数据 | 跨身体汇集真实数据 | 开放一个共享数据公地 |
| 主要数据来源 | 合成与增强轨迹 | 多种机器人的遥操作示范 | 社区贡献的数据集 |
| 具身 | 聚焦人形 | 明确跨具身 | 不限;格式与硬件无关 |
| 开放度 | 开放模型,NVIDIA 技术栈 | 研究与选择性发布 | 完全开源 |
| 主要风险 | 仿真到现实的鸿沟 | 真实采集的成本 | 贡献者之间质量参差 |
把这张表读成对同一个问题的三种回答,而不是一场竞赛里的三名选手。每一种都用承受某一种痛,换取某一种优势。
它们私下里认同的东西
在对立之下,是出人意料的大量共识。三者都是基于 transformer 的 VLA。三者都把人类与遥操作示范当作整个系统生长的种子,连 GR00T 也不例外,它那座合成的高山,底部正是从真实动作放大而来。三者都在意跨具身,因为没有谁负担得起为每一台新机器人从头再来。而三者,包括那个仿真优先的,最终都要拿现实来验证,因为一个只在渲染器里管用的策略算不上产品。像 Open X-Embodiment 这样的汇集语料之所以存在,恰恰是因为没有哪个实验室能单打独斗。
仿真它、汇集它,或者开源它:每一种策略都是应对同一份短缺的不同方式。它们没有哪一个消除了对真实示范的需要。它们只是改变了由谁来录制,以及中间凭空造出多少。
所以,比较 GR00T、pi0 和 LeRobot 的诚实方式,不是问哪个模型最好,而是问你相信哪一种数据理论:更便宜的合成规模、更丰富的真实多样性,还是更广的开放参与。最可能的结局不是某一个胜出,而是一个认真的机器人项目会把三者都用上,然后依然发现自己示范不够,因为那正是横在它们每一个之下的那道约束的形状。