多模态机器人数据:力、音频、深度,超越 RGB
力、接触音频与深度,承载着富接触操作真正依赖、而 RGB 从不记录的信号。该采集什么,以及为何时间对齐才是最难的一环。
在看不见的情况下,把一个 USB-A 接头插进插口。你先插偏了,摸到插口的边沿,把接头转几度,感到里面的舌片落了进去,再往里一推。整个过程不到两秒,而这段纠错里真正有用的信息,几乎没有一点是靠眼睛得到的。它经由指尖化作力,经由那一声轻响化作声音,也来自你的手早已记住的几何形状。
换作大多数机器人学习数据集,这一刻只会被记录成一段视频加一串关节角度。用它训练策略把手伸向插口,够了;可要教会策略在接头卡住时怎么办,就不够了,因为卡住这件事根本不会出现在像素里。富接触(contact-rich)操作,比如插接、擦拭、剥离、切割、扣扣子、叠衣物,主导它的是相机并不携带的信号。
这就是采集 RGB 之外信号的理由。力、音频、深度各自补上了什么,各自又在哪里失效,以及为什么真正困难的工程不在传感器,而在让它们的时钟彼此同步。
相机看不见什么
一帧 RGB 是一次投影。它告诉你各个表面落在画面里的什么位置,采样率取决于快门,通常是 30 到 60 Hz。它不会告诉你两个表面互相压得多紧、抓握是否开始打滑,也不会告诉你任何东西以米为单位有多远。对空间里的抓取放置来说,这种缺失很少要命,策略仅凭视觉流就能纠回来。Open X-Embodiment 数据集汇集了来自 20 多个实验室、超过一百万条轨迹,绝大部分是 RGB 加本体感知(proprioception),照样能训练出可用的伸手与抓取行为。
接触改变了问题的性质。两个刚体一旦相碰,有用的信号就从视觉转移到力学。一根销钉插进只有 0.1 mm 间隙的孔,产生的卡滞力是 30 Hz 相机来不及分辨的,而在狭窄的夹具里往往根本看不见。解决这次插入的策略,反应的是力,不是像素。只用视频训练它,你教会的是靠近的动作,藏起来的却是真正会失败的那一段。
力与触觉:任务真正关乎的信号
触觉这个词底下藏着两种不同的信号。腕部力/力矩(force-torque)是 6 轴读数,在机器人手腕处测出三个力和三个力矩,报告的是手中之物承受的净负载。触觉传感则分布在指尖,报告接触面上的压力分布,常通过视觉式传感器实现,比如 GelSight 那类给自身形变拍照的弹性体。前者告诉你正在用力推,后者告诉你在哪里推、以及是不是快要打滑了。
两者都必须快。接触事件短促而刚硬:一个搭扣就位、一颗螺丝咬上螺纹、抓着的物体开始下滑,都可能在几毫秒内完成。以 30 Hz 采样力,你会把最在意的那个瞬变混叠掉,把一个尖锐事件抹成一团模糊。实用装置读取腕部力/力矩的频率在几百赫兹到 1 kHz,比视频高出一个数量级。RH20T 是一个专门围绕富接触技能构建的操作数据集,正是出于这个原因,它在 RGB-D 之外同时记录了腕部力/力矩和音频。
相机能看着销钉靠近孔位,却感觉不到销钉卡死;而解决插入的策略,恰恰是在对相机错过的东西做出反应。
音频:多数团队略过的模态
音频是最便宜的一路模态,也是最常被从装置上省掉的一路。接触会发声,而这声音往往比力更能判断接触。搭扣的咔哒、海绵刮过干涸食物残渣的沙沙、螺丝就位的顿挫、敲上去发空说明容器是空的那一记闷响:每一个都是起点明确的尖锐声学事件。一支以 44.1 或 48 kHz 采样的接触式麦克风,能捕到 30 Hz 相机完全丢掉的瞬变。
各家学术机器人实验室反复表明,音频携带着真实的任务信号,从区分材质,到比视觉更可靠地锁定接触发生的那一刻。实际的门道在于,机器人音频有用的部分大多是结构传声,因此耦合在工具或手腕上的麦克风,胜过被风扇、空调和旁人淹没的房间麦克风。
深度:度量几何,以及它在哪里失效
深度消除了单帧 RGB 里固有的尺度歧义。一个 RGB-D 传感器直接给你度量几何,这对抓取规划、碰撞检测,以及任何需要把物体放到真实距离而非像素偏移的策略都有帮助。DROID 是一个真实环境(in-the-wild)遥操作数据集,约有 76,000 条轨迹,它在 RGB 之外配上立体视觉与深度,让场景落在度量空间里,而不是停留为一张平面图像。
深度并非没有失效,而且它恰恰在操作最在意的东西上失效。结构光和飞行时间(time-of-flight)传感器,在透明玻璃器皿、镜面金属、细薄边缘和深色哑光表面上,返回的是噪声或空洞。立体视觉需要纹理来匹配,面对一堵空白墙就会失明。而且深度描述的是几何,不是接触;就在两个表面相遇的那一刻,它归于沉默,而那正是任务变难的一刻。
每一路模态各自换来什么
没有任何单独一路是足够的,也没有哪一路是免费的。取舍很具体。
| 模态 | 典型频率 | 补上了什么 | 在哪里失效 |
|---|---|---|---|
| RGB 视频 | 30-60 Hz | 场景布局、物体身份、语义 | 无力、无度量尺度,快接触被混叠 |
| 深度 / RGB-D | 30-60 Hz | 度量几何、抓取与碰撞规划 | 透明、镜面、细薄、深色表面 |
| 腕部力/力矩 | 0.5-1 kHz | 净接触负载、卡滞与推压判断 | 无接触空间定位,存在漂移与偏置 |
| 指尖触觉 | 0.1-1 kHz | 接触位置、剪切、初始打滑 | 视场小、易磨损、标定成本高 |
| 接触音频 | 44.1-48 kHz | 接触起点、事件、材质线索 | 环境噪声,空间定位困难 |
| 本体感知 | 0.1-1 kHz | 关节状态,也就是动作标签本身 | 对手臂之外的世界一无所言 |
难的是时间,不是传感器
把六个传感器拧到装置上,是一个周末的活。让它们的数据合在一起可信,才是真正的工程。每一路数据都带着自己的时钟:视频约 30 Hz,深度约 30 Hz,力在 1 kHz,音频在 48 kHz,关节编码器介于其间。如果一次接触事件持续 5 ms,而你的力与视频时间戳相差 20 ms,任何模型都学不到力的尖峰和视觉事件其实是同一瞬间。它学到的是一个错误的偏移,而错误的偏移比缺失一路还糟。
所以一套采集系统真正的交付物,不是那张模态清单;而是所有模态之间的亚帧时间对齐,外加诚实的逐通道频率标注,好让训练流程知道自己在重采样什么、重采样了多少。Ego-Exo4D 把第一人称与第三人称视频,连同空间音频,在一千多小时上配到一起,它既是一次采集,更是一次多流同步的工程演练。时间戳弄错了,每多一路模态都比没有更糟,因为每一路此刻都在教模型一些本不存在的相关性。
这一切都不是在反对 RGB。视觉仍是主干,策略正是靠它先找到插口。这里的主张更窄,也更难回避。至今仍难倒机器人的任务,是那些富接触的任务;而这些任务栖身于相机本就录不下来的信号里。把它们采下来,对齐到毫秒;否则就继续训练策略,去够一个它永远感觉不到落进去的接头。