RGB 与深度相机对比:机器人该选哪种
深度相机何时值回它的带宽,何时仅凭 RGB 就足以完成机器人操作,以及该采集什么,才不会在源头丢掉几何信息。
把一台深度相机对准家用机器人每天都会接触的三样东西:一个黑色皮革钱包、一杯水和一个铬制水龙头。看看返回了什么。钱包变成了一个空洞,水面沸腾着噪点,水龙头则在半幅画面上涂抹出虚假的几何形状。深度传感器恰恰在厨房里最常见的那些材质上失效。
这就是机器人数据栈中一个最平常的决定背后令人不安的潜台词:用 RGB、深度,还是两者都要?这个问题听起来像是硬件细节。可它真正关乎的是带宽、失效模式,以及策略能从你真正记录下来的像素里学到什么。
深度不是免费的。它消耗带宽、标定、功耗和金钱,而且恰恰在最关键的场景里退化。RGB 便宜且通用,但它把几何问题甩给了网络。一旦把这个选择乘以数千小时的采集量,搞清楚各自何时划算就值真金白银。
深度相机到底给了你什么
深度相机为每个像素返回一个距离。你得到的不是颜色,而是度量几何:这个表面在 42 厘米之外,那条边缘近了 3 厘米。对抓取规划器来说,这是宝藏。你可以仅凭距离就把物体从背景中分割出来,估计它的位姿,并检查夹爪能否避开它上方的搁板。
常见的获取方式有三种。双目从两个 RGB 镜头三角化测距,这也是 DROID dataset 这类大规模真机数据集背后的方法。结构光投射一个已知图案并读取其畸变。飞行时间(ToF)测量一束光脉冲往返所需的时间。每一种都有其标志性的弱点。双目需要纹理,在空白墙面上很吃力。结构光在阳光下会过曝。ToF 在光亮和透明表面上会发生散射。
所以「逐像素几何」这个承诺是带星号的。深度在哑光、不透明、光照良好、有纹理的物体上最可靠,而在玻璃、铬、深色布料、细线,以及正午户外的任何东西上最不可靠。这些在真实家庭里并不是边缘情况。它们就是家常便饭。
仅凭 RGB 已经能做什么
十年前,丢弃深度看起来很鲁莽。如今不再如此。主流的机器人基础模型大多是在 RGB 视频上训练的,因为能规模化拿到的就是这个。Open X-Embodiment 聚合的大多数轨迹都是普通的彩色流,而建立在其上的策略依然学会了抓取、推动和放置。
有两个转变推动了这一点。第一,大型视觉骨干网络学会了从单目线索中隐式地推断几何:明暗、遮挡、透视、运动视差。第二,整个领域转向了从不构建显式 3D 地图的端到端策略。像 NVIDIA Isaac GR00T 所面向的那类模型,直接把图像和语言映射到动作,并能恢复出深度传感器本会测量到的大量结构。
RGB 仍有一个硬性限制:尺度歧义。单张彩色图像无法在同一视角下区分一个真马克杯和一个玩具屋里的马克杯。运动、第二个相机,或画面中已知尺寸的夹爪都能消解它。但如果你的任务依赖绝对的毫米级精度,仅靠 RGB 就是一场赌博。
依赖 RGB 还有一个更微妙的代价。当网络去推断几何时,这份推断的好坏取决于训练分布。给它看一个它从未见过的透明瓶子,猜测就会以深度读数不会有的方式退化。RGB 把失效从传感器转移到了数据上。这是一笔合理的交易,但前提是你的数据确实覆盖了那些困难情形。
| 维度 | 仅 RGB | RGB 加深度 |
|---|---|---|
| 度量尺度 | 单帧下有歧义 | 直接测得 |
| 玻璃、铬、深色布料 | 与普通表面无异 | 丢帧与噪声 |
| 单路带宽 | 基线 | 大约高 1.5 至 2 倍 |
| 标定负担 | 仅内参 | 内参加深度配准 |
| 户外阳光 | 正常 | 结构光失效 |
| 单台相机成本 | 低 | 较高 |
深度何时值回它的带宽
在几个具体场景里,深度不再是可选项。
- 杂乱料箱抓取。当物体相互重叠和遮挡时,距离数据比颜色更干净地把它们分开。这正是工业拾取系统至今仍依赖深度的原因。
- 没有先验的新物体。如果策略从未见过某个物体,也没有语言提示,几何就是判断抓取位置的唯一可靠抓手。
- 对碰撞敏感的运动。把手伸进搁板,或穿行于两件易碎品之间时,你要的是测量出来的间隙,而不是猜测。
- 精确放置。把盖子放到锅上,或把销钉靠近孔位时,几个真实的毫米胜过一个推断出的估计。
Berkeley BAIR blog 上综述的工作反复回到同一个规律。深度在接触临近、且误差代价高昂的地方帮助最大。远离接触时,比如横穿房间的长距离伸手过程中,它大多只是在增加成本。
即便在这里也有微妙之处。透明和反光物体同样会让深度失效,所以恰恰是那些让 RGB 吃力的材质,也能击败深度传感器。近来的工作把两者配对,用颜色去修补 ToF 在玻璃上留下的空洞。教训不是深度是灵丹妙药,而是两种信号在不同输入上失效,合在一起覆盖的比任一单独都多。
深度不是一台更好的相机。它是一份昂贵的保险,只在接触前最后几厘米里才赔付。
这对你采集的数据意味着什么
有一个不对称性应当主导这个决定。如果你记录了深度,之后又判定用不上,你可以在一个下午之内把它丢掉。如果你只记录了 RGB,之后又需要度量几何,你无法把它找回来。那份信息从一开始就不存在。
这就支持采集比当前模型所消耗的更多的信号,只要这些流经过正确的配准和时间同步。对齐的 RGB 加深度,连同内参和外参一并保存,让下游团队可以按任务逐一选择。只交付颜色,你就悄悄给买家未来能训练的东西设了上限。
存储是反方论点,而且它是真实的。深度大致让每台相机的字节数翻倍,在设施规模下,这是一项开支,而非可忽略的零头。但存储便宜且越来越便宜,而一段丢失的录制却一去不返。你可以压缩深度、日后再裁剪、冷归档,但要趁那个瞬间还在时把它采下来。
所以「RGB 还是深度」是个错误的提法。真正的问题是:在任务的哪个环节,几何必须被测量而不是被猜测,以及你在那里能否承受出错。对于横穿空桌面的缓慢伸手,RGB 足以承担。对于伸进杂乱搁板的最后几厘米,深度依然值回它的带宽。一个严肃的数据集会把两者都采下来,保持对齐,然后让模型来决定。