LeRobot:通往机器人学习的开源入口
Hugging Face 的 LeRobot 如何降低机器人学习的门槛:统一的数据格式、200 美元以内的机械臂,以及 ACT、π0 等可微调策略,还有它尚未解决的部分。
过去,一套能用的机器人学习系统意味着一间实验室、一台六位数价格的机械臂,以及一位能让 ROS 技术栈不至于崩溃的研究生。到了 2024 年,它开始变成更小的东西:桌面上一对 3D 打印的机械臂,每只成本约一百美元,一台笔记本电脑,再加上几个小时录制你自己搬动物体的过程。把这些黏合到一起的软件,就是 LeRobot,Hugging Face 面向真实世界机器人学习的开源库。
LeRobot 并没有发明模仿学习或扩散策略。它做的事不那么光鲜,却可以说更有用:它把底层的管道标准化了。一个统一的数据集格式,一组你真的能下载并微调的参考策略,廉价的参考硬件,以及一个把机器人回合数据当作语言模型来对待的托管层。结果是,索非亚的一名学生和斯坦福的一个实验室,如今能用同一种文件格式交换数据。
这正是本文的论点。机器人学习的门槛从来不只在算法,而在于可及性:能不能拿到硬件,能不能拿到可比较的数据,能不能复现那些无需逆向工程论文就能跑起来的基线。这三件事过去各自都是一个独立的工程。LeRobot 一次性降低了这三道门槛,而它的二阶效应仍在展开。
LeRobot 究竟是什么
剥去品牌,LeRobot 其实是三样东西的组合。它是一个 PyTorch 的策略架构与训练循环库。它是一个数据集标准 LeRobotDataset,把同步的摄像头画面、关节状态和动作连同各自的时间戳一起存储,视频编码得足够高效,可以从一台笔记本电脑直接流式读取。它还是一套约定,让你把数据集和训练好的检查点都推送到 Hugging Face Hub,像其他模型一样带版本、可下载。
这个项目由来自工业人形机器人领域的工程师主导,其优先级也透着这一点。库里提供端到端的流程:录制遥操作回合、编码视频、训练策略,再在同一套硬件上回放。这个循环里没有任何新颖的研究。过去它却是每个实验室各自定制的。把它变得无聊而共享,正是意义所在。
硬件入口
如今进入这个领域最便宜的方式,是一只打印出来的机械臂。LeRobot 的参考平台 SO-100 及其后继 SO-101,是由业余舵机驱动的低成本主从机械臂。你用手移动主臂,从臂随之镜像,软件则把关节轨迹和摄像头画面记录为一个训练回合。ALOHA 和 Mobile ALOHA 则高一档,用于双臂任务。
成本才是关键。一只从臂的零件价格在一百到两百美元量级,比研究级机械臂低一到两个数量级。这并不能让它成为一台好的工业机器人,却能让它成为一位好老师:自由度和重复精度足以采集真实示范,又便宜到一个教室能拥有十台。由于零件清单和固件都是公开的,整套装置可复现,因此在一个房间里录制的数据集,可以在另一个房间里回放并继续扩充。
可以微调、而不只是拿来读的策略
这个库的模型库,正是入口与前沿相遇之处。近期论文里出现的若干架构,都以可运行的基线形式提供;而且至少有一个量产级的视觉-语言-动作模型被开源进了这个生态:Physical Intelligence 发布了 π0,一个基于流匹配的 VLA,并被移植过来,让你能用自己的回合数据微调它。Hugging Face 自家的 SmolVLA 则朝另一个方向发力,是一个刻意做小、能在普通硬件上运行的 VLA。
| 策略 | 学习方式 | 适用场景 |
|---|---|---|
| ACT | 带动作分块的监督式模仿 | 由数十条示范学到的短程、精确操作 |
| Diffusion Policy | 对动作序列做去噪扩散 | 多解、接触密集、存在多种合理动作的任务 |
| VQ-BeT | token 化的行为 transformer | 离散、多行为的设定 |
| TD-MPC | 基于模型的强化学习 | 能仿真或能重置任务、且看重样本效率时 |
| π0 / SmolVLA | 预训练的视觉-语言-动作模型 | 语言条件任务;微调而非从零训练 |
真正的转变,是从从零训练走向微调。一个在大规模跨机器人语料上预训练的 VLA 给你一个热启动,几百条你自己的回合就能把它专门化。这与让语言模型变得可及的配方如出一辙,只是搬到了关节和夹爪上。
安静的创新其实是数据格式
问一位资深机器人研究者,2024 年之前最耗时间的是什么,常见的回答是数据整理。每个实验室记录示范的方式都不同:各自的时间戳约定、各自的相机标定、各自存储动作的方式。在一个实验室的数据上训练出的策略,没有定制适配器就读不了另一个实验室的数据。LeRobotDataset 恰恰针对这一点:一套 schema,在 Hub 上带版本管理,还有一份不断增长、一行代码即可拉取的社区数据集目录。
它也和这个领域如今依赖的大型聚合数据集配合得很好。Open X-Embodiment 把数十种机器人的示范汇聚起来,证明了跨形态训练确有帮助;DROID 贡献了大约 76,000 条遥操作轨迹,采集自众多楼宇与场景。正是共享格式,才让新手能把自己那一百条桌面回合与这类语料混在一起,而不必二选一。
共享的数据集格式之于机器人学,正如统一的图像格式之于计算机视觉:进步得以累积,而不必在每个实验室从头再来。
入口的尽头在哪里
这一切都没有解决那些真正困难的问题。一个在你厨房灯光下、在你的 SO-101 上能完美完成任务的策略,一换背景、一换物体实例,或换个时段,往往就会失败;泛化仍是核心的开放问题。评测大多仍靠人工,跨装置之间难以比较。而那些低成本机械臂,在力与速度的极端处,把精细操作教得并不好。
尤其是,遥操作机器人数据的规模化代价高昂:每一个回合都需要一个人实时驾驶一台机器人。这正是前沿实验室转向其他来源的原因:仿真,例如 NVIDIA 的 Isaac GR00T 技术栈;以及人类视频,那里像 Ego-Exo4D 这样的第一人称数据集,记录人们以第一人称视角完成任务,回路中根本没有机器人。
从小处开始,把一切都公开
给任何好奇者的诚实建议并不光鲜:买或打印一只机械臂,录制某个单一任务的一百个回合,微调 ACT 或一个小型 VLA,再把数据集和检查点都推到 Hub 上。你从一个失败的真实世界策略里学到的,会比读一个月资料更多。这条路之所以存在,是因为 LeRobot 把一堆实验室各自的仪式,变成了共享的基础设施。模型会不断变化,而这个入口,才是让下一个模型容易上手的东西。