手腕相机与第三人称视角之争
手腕相机看见指尖,第三人称视角看见整个房间。本文讲清每种视角教给操作策略什么,以及为什么你要把两者都采下来。
把一台相机装在机器人的手腕上,它就能看到大多数相机看不到的世界:夹爪的闭合、马克杯的确切杯沿、螺纹咬合的那一刻。若改把它架在机器人的肩膀之上,你看到的是整个工作空间:手臂、桌面、旁边的人,但指尖缩成了几个模糊的像素。同一个任务,两台相机,两种截然不同的教益。
手眼(eye-in-hand)与第三人称之争,是机器人操作中最古老的抉择之一,而它之所以反复出现,是因为没有哪个视角能全面胜出。每一个都恰好丢掉了另一个所保留的东西。
这个决定并不空泛。它决定了策略能关注什么,也决定了你的采集装置必须记录和标定什么。选错了,你会采下数千小时,却悄悄地教不会你想要的那项技能。
手腕相机教会了什么
手眼相机就在动作发生之处。它最大的馈赠是不变性。由于相机随夹爪一起移动,无论物体在左、在右、在近、在远,一次抓取的画面看起来都相似,于是策略只需更少的示范就能覆盖同样的空间。像 DROID dataset 这样的大型多视角数据集正是出于这个原因才包含了手腕相机。
它还能看到接触。手指触到边缘的那一刻,手腕视角以全分辨率捕捉到它,这对插入、对齐,以及任何在最后一厘米内见分晓的任务都至关重要。像 RH20T 这样的富接触数据集正依赖这种近距视角。
代价是实实在在的。手腕视角对房间没有记忆,因此不擅长全局规划。它随手臂运动而剧烈摆动,带来运动模糊。而且夹爪本身会在最糟糕的时刻遮挡你最关心的那个接触点。手腕相机是个专才:近处出色,远处失明。
还有第二个更安静的好处。分辨率并非均匀分布。手腕相机把大部分像素花在物体和夹爪上,恰恰是任务见分晓的地方。固定相机则把大部分像素花在桌面、墙壁和空气上。在同样的传感器预算下,手眼视角只是把细节放到了要紧之处。
第三人称视角教会了什么
越肩相机保持着稳定而宽阔的画面。它看到整个场景:目标、障碍、另一只手、下达指令的人。这使它成为长时程规划和语言接地(grounding)的天然归宿,因为指令通常指向整个工作空间里的物体。Open X-Embodiment 中的大多数轨迹都来自固定的第三人称相机。
它的弱点是精度。夹爪和物体只占图像中很小的一块,因此精细对齐很难看清。手臂经常遮挡目标。而且由于相机固定于世界坐标系,同一物体在新位置看起来就不一样,所以你需要更多数据来覆盖手腕相机免费覆盖的那部分空间。
团队常常架设不止一台外部相机来对抗遮挡。来自不同角度的两三个固定视角,意味着手臂很少同时挡住全部,而策略可以从视差中三角化出粗略的深度。代价是标定。每多一台相机,就多一组要在整场场次里求解并保持稳定的内参和外参。
| 属性 | 手腕(手眼) | 第三人称(外部视角) |
|---|---|---|
| 接触的可见度 | 全分辨率 | 细小,常被遮挡 |
| 全局场景语境 | 几乎没有 | 完整 |
| 对物体位置的不变性 | 高 | 低 |
| 语言接地 | 弱 | 强 |
| 运动模糊 | 频繁 | 罕见 |
| 覆盖一个任务所需示范 | 更少 | 更多 |
为什么严肃的技术栈两者都记录
这两种视角是互补,而非对手。Berkeley BAIR blog 以及 NVIDIA Isaac GR00T 所面向的系统中一个反复出现的发现是:把稳定的第三人称视角与手腕视角融合,对精细操作成功率的提升,超过任一视角单独使用。第三人称流承载规划。手腕流承载接触。同时读取两者的策略,既能决定去哪里,又能在到达时闭合控制回路。
消融实验往往印证这一点。去掉手腕相机,插入类任务最先崩溃。去掉第三人称相机,漫长的多步骤任务会丢失线索。
这一切记录起来都不是免费的。每一路流都增加带宽、存储和标定负担,而你装的相机越多,装置失去同步的方式也越多。工程上的问题不是理论上多少视角有用,而是你能在一次又一次的场次里、让时间戳不漂移地保持对齐的视角有多少。
第三人称相机告诉策略该去哪里;手腕相机告诉它到达时正在发生什么。
这对人类数据采集提出了什么要求
人类示范以一种有用的方式让画面复杂化。头戴式第一人称相机既不是手腕相机,也不是固定的第三人称相机;它是一个随注意力移动的第一人称视角。操作时它看着双手,伸手时它看着场景,随着人的目光在两者间切换。这与移动机器人真正经历的相当接近。
但仅靠它并不够。为了干净地迁移,采集若能加入近手视角和一个稳定的外部相机,并全部做时间同步、标定到共享坐标系,会更有价值。只记录头部视角,你就失去了固定的锚点。只记录固定相机,你就失去了亲密的接触细节。
注视为机器人很少捕捉的东西加了一层。人会看向自己即将动作的地方,所以第一人称视角不只是第一人称;它被意图所中央凹化,在接触的瞬间停留在双手上,在伸手时向前扫视。那份注意力信号本身就是一种标注,告诉下游模型画面中哪一部分才重要。
所以对于手眼与第三人称,诚实的答案不是谁胜出,而是分工。宽视角框定任务、接地语言;近视角解析决定成败的接触。一个把两者都采下、并对齐到毫秒的数据集,为下游保留了每一种选择。只采其一的数据集,无论是否有意,都已经替别人做了决定。