开源与封闭的机器人基础模型:谁在获益

开源机器人模型之争的实战指南:LeRobot 生态与 Gemini Robotics 等专有技术栈如何较量,以及谁真正获益。

阅读约 6 分钟

像下载语言模型一样下载一个机器人策略。2025 年的机器人领域大致就走到了这一步。Hugging Face 的 LeRobot 提供模型权重、数据集,以及一套能在单块消费级 GPU 上跑通的训练流程。Physical Intelligence 公开了 π0 的权重,这是迄今已发表的、能力较强的通用操作策略之一。NVIDIA 让 Isaac GR00T N1 站上了同一条起跑线:开放权重,外加一套面向人形机器人的开放后训练方案。如今,一名研究生和一间资金充裕的实验室,可以从相近的检查点出发。

再看另外半个赛道。Google DeepMind 的 Gemini Robotics 以 API 和少数几家合作方集成的形式交付,而不是一份可下载的权重。Figure、1X 和 Skild 把各自的策略锁在机器人和公司内部。两种路线如今在同样的硬件上并行推进。真正值得问的,不是这个季度谁的演示更亮眼,而是谁能持续复利。

真正的分野,并不是抽象意义上的“开放对封闭”。它是一叠具体的选择:谁掌控模型,谁能审视它,谁能不经许可就把它部署出去,以及在这一切之下,谁拥有那份决定模型上限的数据。

“开放”在这里究竟指什么

机器人基础模型的开放至少有四个层面,而几乎没有哪一次发布把它们全部打开:权重训练代码许可证,以及数据。GR00T N1 和 π0 是开放权重、开放代码的,你可以微调并自行部署,这已是很大的馈赠。但它们预训练所用的语料只有部分披露,许可证在允许何种商业用途上也各不相同。

与之相对的,是那些真正开放的数据集。Open X-Embodiment 把来自 22 种机器人本体、数十间实验室的数据汇入一个集合,量级约在一百万条轨迹。DROID 又补上了大约 76,000 段在真实场景中采集的遥操作演示,覆盖大量场景。RH20T 则推进了富接触的多模态操作。这些是开放数据,也正是开放权重模型得以存在的根基。教训在于:多数“开放”的机器人模型是开放权重,而非开放数据,两者不是同一种自由。

开放阵营:作为引力中心的 LeRobot

与其说 LeRobot 是一个模型,不如说它是一口引力井。它统一了数据集格式,在 Hub 上托管数以千计的社区数据集与策略,还提供像 SmolVLA 这样无需集群即可训练的小模型。再配上价格在 $100-500 区间、可复现的机械臂,你就得到了封闭阵营无法靠命令制造出来的东西:一层共享的底座,一个小组微调出的成果,下一个小组可以直接加载。

回报会不断累积。每一份以通用格式上传的数据集,都让下一个模型的训练更便宜。每一个公开的策略,都招来一次基准测试、一份缺陷报告、一次分叉。这正是让开放语言模型成为研究默认选项的那股动力,被移植到了真实硬件上,而硬件的可复现性一向惨淡。

开放权重让上千间实验室从同一个检查点出发,却没有给它们同一份数据。真正的分岔,正是从这里开始的。

封闭阵营:把垂直整合当作战略

封闭的玩家并非出于习惯而囤积。垂直整合本身就是赌注。当一家公司同时拥有硬件、遥操作车队、模型和部署,它就掌控了一个数据飞轮:机器人在客户现场每运转一小时,都会喂给下一轮训练。Gemini Robotics 依托 Google 更广的多模态模型,并把权重藏在接口之后。Figure 为自家人形机器人打造自家的 VLA。它的优势在于单一本体上的一致性与速度,外加商业护城河,以及在安全与责任上更清爽的叙事,毕竟没人能分叉一个你从未交付的策略。

代价是覆盖面。封闭模型只能在其拥有者能采集的数据上进步;开放模型则在所有人采集的数据上进步。放到足够长的时间轴上,这是两条截然不同的增长曲线,而哪条曲线在哪类任务上胜出,并不显而易见。

记分板:每一阵营究竟给到你什么

开放权重生态与专有技术栈:各自真正交到你手上的是什么。
维度开放阵营(LeRobot、π0、GR00T N1)封闭阵营(Gemini Robotics、Figure、1X)
权重获取可下载、可自行部署仅限 API 或设备端
训练数据部分公开,另有开放数据集(OXE、DROID)专有、未披露
定制能力可在自有机器人上完整微调受限,需经厂商中介
部署无需许可受合同与集成约束
数据飞轮由社区共享被单一运营方独占
最适合研究、初创、多机器人车队只做单一平台、资金充裕的 OEM

谁在获益,真正的瓶颈又在哪

对一个研究小组或种子期初创而言,开放近乎氧气。在一份不大的数据集上微调 π0 或 GR00T,其成本相较于从零预训练一个通用策略,不过是四舍五入的零头,而后者除了最大的几家实验室,几乎没人负担得起。对机器人 OEM 来说,算盘则确实复杂:开放的底座压低了模型开销,但持久的优势会转移到拥有部署数据的一方,于是许多厂商会在私有数据上微调一个开放模型,再把这份微调结果封闭起来。对资金雄厚的在位者而言,只要内部飞轮跑得比社区快,封闭就依然理性。而对整个领域来说,那些开放数据集才是沉默的基础设施:没有 OXE、DROID 和各类第一人称语料,两个阵营都不会有一个大到足够要紧的底座。

无论说不说出口,两个阵营其实都同意一件事。真正的约束不是模型架构,也不是算力,而是数据:真实、多样、有物理依据、记录身体完成任务的资料。如果每间实验室都在同样那几千条轨迹上微调,开放权重帮不上忙;如果一个封闭飞轮永远只见到一座工厂,它也帮不上忙。机器人还没有属于自己的网络级语料,而语言模型与机器人模型之间的差距,多半就是一万亿 token 文本与几千小时具身演示之间的差距。

这将走向何方

在任何一方胜出之前,两个技术栈更可能先彼此交融。未来数年更可能的样式是:一个开放的基础模型,在私有演示数据上微调,再以商业合同的形式部署。凡能压低成本处开放,凡能守住利润处封闭。在那样的世界里,筹码既不在模型发布方,也不在机器人厂商,而在能规模化生产具身数据、并把它干净地交付出去的那一方。盯住数据集,而不是检查点。

open-sourcelerobotfoundation-modelsrobot-datavla

来源