遥操作数据是如何端到端采集的
从主从采集装置到带标注轨迹,完整走一遍遥操作数据流水线:多路时钟同步、演示数据 QA 与轨迹 schema 的取舍,究竟在哪里决定成败。
一次用于训练叠衣服策略的遥操作采集,可能持续 4 小时,最终只有 90 分钟真正值得拿去训练。其余的时间,是操作员在两次尝试之间重新摆位、一帧丢失的立体相机图像、夹爪明明报告 closed 而毛巾却从指间滑走,或者一段在流程上"成功"、却悄悄教会模型一个没人想要的习惯的演示。采集机器人演示数据,与其说像拍视频,不如说像经营一间毫不留情的小型录音棚:五个时钟各说各话,而"演员"是一条 7-DOF 的机械臂。
这是机器人学习栈里最少被写进发布公告的一层。拿到头条的是模型:NVIDIA Isaac GR00T、Physical Intelligence 的 pi-0、Toyota Research Institute 的 Large Behavior Models、Google DeepMind 的 Gemini Robotics。它们每一个都是喂进去的那些轨迹的函数,而这些轨迹绝大多数都始于一个人有意地带着机器人走完一项任务。真正决定数据质量的,是从采集装置到带标注轨迹之间发生的那些事。
把这条流水线从头走到尾,会反复撞见同一个教训:难点不在机器学习,而在计时、对齐和无情的筛选。下面是完整流程。
采集装置决定了你到底能记录什么
遥操作,指的是人实时驱动机器人,同时记录每一路信号。人怎么驱动,在第一帧被保存之前,就为数据设定了上限。主流有四类。
主从遥操作用一条小型复制臂配对真实臂,操作员移动主臂、从臂随动。ALOHA 让这种方式在双臂操作上流行起来,GELLO 则证明用几百美元的 3D 打印件和舵机就能搭出一条可用的主臂。运动手感直接,关节映射干净。VR 与手持控制器让操作员摆脱物理复制臂,广泛使用的 DROID 数据集,就是用 Oculus 控制器驱动 Franka 臂、跨越数十栋楼采集的。手套与外骨骼能捕捉手指级灵巧度,还能把力反馈给操作员,代价是标定和逐人适配。动觉示教直接用手引导机械臂,不需要接口硬件,却记录不到自然的相机视角,也无法规模化。
| 接口 | 力反馈 | 灵巧度上限 | 装置成本 | 吞吐量 |
|---|---|---|---|---|
| 主从式(ALOHA, GELLO) | 有限 | 高,双臂 | 低到中 | 高 |
| VR / 手持控制器(DROID) | 无 | 中 | 低 | 高 |
| 手套 / 外骨骼 | 有 | 很高,手指级 | 高 | 中 |
| 动觉引导 | 原生 | 低到中 | 接近零 | 低 |
每一路数据流都有自己的时钟
一次演示不是一段录像,而是一束以不同频率采样的数据流。RGB 相机跑在 30-60 Hz。关节编码器和末端本体感知以 100-1000 Hz 上报。腕部的力-力矩传感器可能更快。遥操作指令则在操作员移动时才到来。它们天生不同步,而毁掉一个数据集的错误,恰恰是假设它们同步。
解法枯燥却没得商量:在源头就用同一个共享时钟给每个采样打时间戳,事后再重采样到统一时间轴,而不是信任到达顺序。像 DROID 那样的立体相机加腕部相机的多相机装置,必须做时间同步和几何标定,否则深度与动作会互相矛盾。更隐蔽的陷阱是动作-观测对齐。操作员是对上一刻看到的画面做出反应,于是原始日志把每个动作,和一个操作员在动手时尚未看到的观测配在了一起。若在这种错位一帧的配对上训练,你就是在教策略对未来做出反应。校正端到端延迟,往往是几十毫秒量级,是构建轨迹的一部分,而不是可有可无的润色。
演示数据集首先是一件同步产物,其次才是行为数据集。时钟错了,下游的每一个标注都会继承这个误差。
大多数演示都悄悄是坏的
要假设相当一部分原始采集不适合训练,并据此设计流水线去把它们找出来。这些失败很少是戏剧性的。相机在 USB 带宽压力下丢帧。某个时钟在中途漂移超出容差。夹爪状态读作 closed,而物体其实从未被抓住。操作员停下来思考,留下三十秒几乎静止的画面。一次力尖峰,标记了一次操作员化解了却从未标注的碰撞。
认真的采集会跑一套两级筛选。自动检查抓机械性故障:丢帧计数、时间戳间隙、与指令运动相矛盾的本体感知、超出合理包络的力读数,以及太短或太空、承载不了信号的片段。人工复核负责判断:任务是否真的完成,策略是不是你想教的那一种,语言指令(把毛巾对折)是否诚实地描述了机械臂做的事。RH20T 把超过 110,000 段机器人操作序列与力-力矩、多视角视听数据配对,它提醒我们:一旦记录了更丰富的通道,也就获得了更多让一段片段以微妙方式出错的途径。成功和失败的片段都值得留下,但前提是被如实标注。
从原始日志到带标注轨迹
幸存下来的采集会被重塑成固定的 schema,好让训练循环无需特例就能消费它们。一个 episode 变成一串有序的步骤,每一步是一个字典:一路或多路相机图像、本体感知状态、所采取的动作、一个 done 标志,通常还有一条自然语言指令。有两种格式占主导。RLDS,也就是 Open X-Embodiment 背后的格式,把 episode 打包成嵌套的 TensorFlow 数据集;Hugging Face 上的 LeRobotDataset 格式,则成了开源社区的通用货币,并自带加载、可视化和分享 episode 的工具。
这一阶段的三个选择,决定了下游的一切。其一是动作空间:绝对关节角,还是末端执行器增量。增量在相似机械臂之间迁移得更从容,一旦你混合多种本体,这一点立刻变得关键。其二是归一化:动作和状态按维度重新缩放,使任何一路通道都不至于主导损失,而归一化统计量必须随数据一起走。其三是跨本体元数据:Open X-Embodiment 把来自 22 种不同机器人的一百多万条轨迹缝进同一个训练语料,而这之所以成立,是因为每个 episode 都声明了自己的本体、相机布局和控制频率。缺了这些元数据的轨迹,在混合数据集里几乎一文不值。
谁都逃不掉的取舍
遥操作换来的是干净、因果正确、本体正确的数据,而它一直很贵,因为每一秒都有人在回路里。正是这个事实,驱动了这个领域大多数的结构性押注。Physical Intelligence 依赖广而杂的数据,让一个模型跨越多种机器人。Toyota Research Institute 把大量遥操作演示汇入 Large Behavior Models,而不是为每个任务单独训练一个策略。另一些人则押注第一人称人类视频,Ego-Exo4D 是其中的参考数据集之一,以此绕开机器人这个瓶颈,用本体差距换取规模。没有免费的车道。更多规模,通常要拿保真度或来源可溯性去换;而更高保真度,通常要拿吞吐量去换。
真正的功夫在哪里
下次当一台机器人干净利落地完成一次双臂叠衣,请记住:真正了不起的部分发生在几个月前,在某个房间里,有人判断了十六个小时里,哪四个小时诚实到值得留下。采集装置是最容易的部分。时钟、筛选和标注才是手艺,也正是它们,把一个模型真能从中学习的语料,与一堆只是看起来像数据的片段,区分了开来。