Open X-Embodiment、DROID 与 RH20T:三大机器人操作数据集对比

从规模、传感器与溯源三个维度对比 Open X-Embodiment、DROID 与 RH20T,并解释为什么单看原始轨迹数量往往会误导判断。

阅读约 7 分钟

先看一个人人都爱引用的数字:Open X-Embodiment 号称包含 100 万条以上真实机器人轨迹,听上去很有分量。可一旦细看,就会发现这 100 万条是由 60 多个各自独立的数据集拼接而成,记录自 22 种不同的机器人,而它们对"一个动作"到底是什么并无共识。一台机器人的"移动"是关节速度指令,另一台是末端执行器位姿,第三台记录的则是离散化的夹爪开合。规模是真实的,可比性却不是。

这道裂缝,正是现代操作数据的全部故事。被引用最多的三个数据集,Open X-Embodiment、DROID 与 RH20T,是对同一个问题的三种不同回答:到哪里去找足够多的示范,才能训练出可泛化的策略。Open X-Embodiment 把社区已有的一切汇聚起来;DROID 把一台标准化机械臂搬进数百个真实房间;RH20T 则收窄范围,尽可能装上每一个值得记录的传感器。没有谁是能一锤定音的"最大",因为它们衡量的根本不是同一件事。

有价值的对比沿三条轴展开,而人们常引用的只是第一条。规模告诉你存在多少段轨迹,更重要的是,一段轨迹究竟值多少。传感器决定模型能感知到什么。溯源,也就是谁采集了数据、用什么硬件、遵循什么协议与许可,决定了这些数字之间是否可比,以及你在法律上是否被允许用它们来训练。买方往往低估第三条轴,直到它把项目卡住。

"规模"掩盖了什么

先按字面接受三个头条数字。Open X-Embodiment 汇聚了来自 60 多个既有数据集、22 种机器人本体的 100 万条以上轨迹。DROID 贡献约 76,000 条遥操作轨迹、约 350 小时,覆盖 564 个场景与 86 项任务。RH20T 收录了 110,000 条以上的机器人回合,并配有成对的人类示范,覆盖 147 项任务。若只论原始数量,Open X-Embodiment 领先一个数量级。

现在为"一段回合值多少"打个折扣。Open X-Embodiment 的百万级数据天生是异构的:机械臂、夹爪、控制频率、相机数量与动作空间各不相同,被归一化进统一的 RLDS 格式,却没有被归一化到统一的物理。策略必须隐式地学会自己正看着哪一台机器人。DROID 的回合是均匀的,因为硬件是固定的,于是变化落在你想要的地方,即场景与任务,而非平台。RH20T 用聚合轨迹总量换取深度:范围比聚合语料更窄,但每一次交互都记录了多数数据集从不采集的接触信息。

三个操作数据集速览。数字均为各项目公布值并做四舍五入。
维度Open X-EmbodimentDROIDRH20T
规模100 万条以上轨迹约 76,000 条、约 350 小时110,000 条以上回合加人类示范
本体22 种机器人、60+ 数据集1 种(Franka Panda)多种臂-夹爪配置
相机与深度继承而来,混杂3 路立体(2 场景,1 腕部)多视角 RGB-D
额外感知因来源而异立体深度力-力矩、音频
溯源联邦式聚合标准化,13 家机构单一项目,配对人类
任务与场景极广但不均86 项任务、564 个场景147 项任务

三种传感器哲学

传感器决定策略能关注到什么,而这里三者分道扬镳。Open X-Embodiment 继承了每个贡献实验室恰好记录下来的东西。许多来源数据集只带一路 RGB 相机、没有深度;有些加了腕部相机;少数以高频率记录本体感知。这个并集广博却参差,训练其上的模型必须容忍缺失的通道。

DROID 把装置标准化。每一段回合都使用一台 Franka Panda,配两台场景端 ZED 立体相机和一台腕部 ZED,为每一帧提供经标定的立体深度。这种一致性正是要点:若你想研究策略能否跨厨房与办公室泛化,就不该让相机配置在脚下变来变去。深度来自立体视觉,它比主动式传感器更廉价、更便携,但在无纹理表面上噪声更大。

RH20T 走向另一端,为接触而装配。除了多路经标定的 RGB-D 视角,它还记录六轴力-力矩与音频,也就是当任务涉及插入、擦拭,或任何仅凭视觉无法判断夹爪是否用力过猛的场合里,真正要紧的那些通道。对接触密集型操作而言,这份额外感知往往比再多 100,000 段纯视觉片段更值钱。

在你弄清每一帧背后的机器人、传感器与许可之前,轨迹数量不过是一个虚荣指标。

溯源决定了你能信任什么

溯源这条轴,决定了另外两条是否真正可用。Open X-Embodiment 是一个联邦:它的力量在于统一了数十项彼此独立的工作,它的负担则在于连带继承了它们的许可、同意状态与文档质量。有些子数据集许可宽松、描述完备;另一些则元数据单薄。若你在这个数据池上训练商用策略,你就继承了这份拼凑,必须逐个数据集地去核查。

DROID 是作为一个协同项目采集的:50 名采集者分布在北美、亚洲与欧洲的 13 家机构,用同一套协议在同一套硬件上跑了约一年。这份协同为你换来干净、可比的元数据,以及一份可以厘清的单一许可。RH20T 更为收敛,是一个单一研究项目,配备固定的传感器栈,并为相同任务录制了成对的人类示范,这正是让"人到机器人"迁移实验在其上可行的原因。

对工程师而言这不是文书工作。溯源决定了可复现性,决定了你能否按机器人或场景筛选,能否在法律上交付一个用该数据训练出的模型,以及合作方的尽职调查团队会不会签字放行。溯源越干净,审计时的意外越少。

各自擅长训练什么

这些差异对应着不同的用途。Open X-Embodiment 的存在是为了证明跨本体迁移:在其上训练的 RT-X 模型表明,跨机器人汇聚数据能提升对任意单台机器人的表现,此后这个汇聚语料便成了通用策略的默认预训练基座。诸如 NVIDIA Isaac GR00T 与开放的 Hugging Face LeRobot 生态等跨本体基础模型工作,依托的正是这一前提:本体的广度是特性,而非噪声。

DROID 面向固定平台上的泛化研究:让机器人保持不变,改变世界,测量什么能迁移。RH20T 面向接触与力起决定作用的技能学习,以及从成对人类示范出发的一次性模仿。若你的目标是一台 Franka 级机械臂去做各种家务,DROID 更贴近你的分布。若你的目标是接触密集的装配,RH20T 的力通道很难替代。若你的目标是一台它们都未曾用过的机器人,Open X-Embodiment 的广度就是那份对冲。

如何取舍

没有单一赢家,把轨迹数量当作排名,正是团队最终措手不及的原因。当你需要本体广度、且能消化许可与归一化的工作量时,选 Open X-Embodiment。当你想在已知机械臂上获得受控的场景多样性时,选 DROID。当接触与力决定任务成败时,选 RH20T。然后亲自去读原始资料:Open X-EmbodimentDROIDRH20T 各自对自身取舍的说明,都比任何一张汇总表更诚实。盒子上的那个数字,从来都不是重点。

open-x-embodimentdroidrh20tmanipulation-datasetscross-embodiment

来源