本体感觉:机器人看不见的那种感觉

本体感觉,即机器人对自身关节与用力的感知,是视觉被遮挡时操作所依赖的信号,也是被动视频无法提供的东西。

阅读约 6 分钟

闭上眼睛,用手指去摸自己的鼻子。你并不需要看着手,就能找到它。这种告诉你四肢在哪里、无需用眼睛确认的感觉,就是本体感觉(proprioception),它在你用身体做任何事时都在持续运作。

机器人也拥有同样的感觉,而且这可以说是它最可靠的一种感觉。摄像头会被眩光致盲、被机械臂自身遮挡,或被反光表面欺骗。关节编码器却几乎从不撒谎。然而在用互联网规模视频训练人形策略的热潮中,本体感觉恰恰是最常被遗漏的通道,而这种遗漏悄悄限制了一个操作策略所能达到的上限。

本文只想论证一件事:本体感觉不是机器人学习里的配角。对于接触密集型操作,它是承重结构。而正因为被动视频里根本不包含它,能否把本体感觉采集好,就是区分「真正能训练出策略的数据」与「只是看起来有用的数据」之间最清晰的一条线。

本体感觉到底编码了什么

在机器人上,本体感觉是一组描述自身构型与用力状态的内部信号。它不是单一的数字,而是一束信号。

  • 关节位置:每个驱动关节的角度,通常来自编码器,采样很快。
  • 关节速度:每个角度变化的快慢,控制器需要它来保持稳定。
  • 关节力矩或电流:每个电机施加的力,是接触力的一个廉价代理量。
  • 末端执行器位姿:手在空间中的位置,通过正向运动学从关节角度推算得到。

把这些合在一起,就能告诉策略此刻身体正在做什么,而且与场景无关。视觉系统说「杯子在那边」。本体感觉说「我的手在这里,正以这个速度移动,正用这么大的力去推」。一个好的操作策略两者都需要,并在每个控制步上融合。

没有它,操作就会崩溃

设想一根轴要插进一个只有零点几毫米间隙的孔里。轴一碰到孔沿,摄像头就再也看不到接触点了,手指把它挡住了。最关键的物理过程,恰好发生在视觉变黑的地方。

此时仍然有效的,是身体自己的报告。关节力矩的小幅上升,意味着轴卡到了边缘。关节速度的突然停滞,意味着运动在到达目标前就停了。人手解决这些问题主要靠触感,而不是靠看,机器人也必须如此。

还有第二种失效模式:漂移。只读像素的策略,对自身运动没有直接感知,于是微小误差不断累积,却没有任何可对照修正的参照。本体感觉闭合了这个环。它给策略提供一个关于自身状态的高频、低延迟信号,而 30 Hz 且常有延迟的视觉根本无法匹敌。

视觉告诉机器人关于世界的信息,本体感觉告诉它关于自己的信息。拿掉后者,操作就变成了猜测。

采样率本身就是信号的一部分

如果本体感觉来得太慢,它就没什么价值。接触事件发生在毫秒之间。一次打滑、一次碰撞、一次干净的配合,都会先表现为力矩的尖峰或速度的突变,如果你按 30 Hz 采样,就会错过它。

所以采集率和采集内容一样重要。关节状态通常以远快于摄像头帧率的速度记录,常达 240 Hz 或更高,再与较慢的视觉流对齐。这种不匹配是刻意的。你希望本体感觉密到足以捕捉物理过程,视觉密到足以捕捉场景,各自按自己的原生速率工作。把所有数据都按一个慢速率记录的数据集,恰恰丢掉了让本体感觉有价值的那部分信号。像 Ego4D 里采集的那种被动第一人称素材,意图丰富,却完全没有本体感觉。

表 1:常见机器人数据来源中的本体感觉内容
数据来源关节状态力矩或力典型速率能教会什么
被动人类视频(Ego4D)约 30 fps语义、意图、场景背景
遥操作机器人(DROID)有时有约 10-30 Hz 记录完整状态加动作,单一具身
多模态采集(RH20T)可达数百 Hz带力的接触密集型技能
聚合语料(Open X-Embodiment)混合混合随来源而异跨具身的广度,状态参差不齐

如何从人身上采集本体感觉

人类示范是廉价且可扩展的来源,但人身上并没有关节编码器。那么怎样才能从一个人身上得到本体感觉?

有两条路。第一条是遥操作:人去驱动一台真实机器人,机器人自己的编码器记录下真值本体感觉,而人提供意图。像 DROIDRH20T 这样的数据集,就是这样得到干净的关节和力数据的。代价是吞吐量和成本,因为每一小时数据都需要一台机器人和一名操作员。

第二条路直接重建人类的本体感觉,借助可穿戴设备和视觉。惯性传感器、手部追踪手套和多相机装置,估计出人体和手的关节角度,再重定向到机器人的运动学上。这条路更难做对,因为重建出的关节角度是估计值,而不是编码器读数。但它能以遥操作永远做不到的方式扩展,这也正是自我视角采集立足之处。

两条路最终服务于同一个下游需求:一个与视觉、动作在时间上对齐的状态向量,让像 NVIDIA Isaac GR00T 这样的模型能与摄像头画面和一条语言指令一起消费它。像 Open X-Embodiment 这样的语料同时展示了价值和问题:跨越许多机器人的广度,但本体感觉字段不一致、量纲各异,有时干脆缺失。

机器人所信赖的信号

本体感觉并不光鲜。它产生不了惊艳的可视化,也做不出病毒式的示范。但当灯光熄灭、手指挡住视线时,它正是机器人所倚赖的那个信号,而那一刻恰恰决定了操作的成败。

正在构建人形基础模型的团队早已明白这一点。这就是为什么他们的状态向量里包含关节角度、速度和力矩,而不只是像素。对任何采集训练数据的人来说,问题在于:管线是否以物理所要求的速率保住了这个信号,还是悄悄丢弃了它,寄望视觉能兜底。它兜不住。

proprioceptionjoint-statescapturemanipulation

来源