触觉:机器人数据中缺失的那一种模态

机器人抓取物体的那一刻,RGB 视频就失明了。本文讲清触觉与力数据为操作带来了什么,以及为什么这类数据始终稀缺。

阅读约 6 分钟

一只机械臂把夹爪缓缓降向半杯咖啡的纸杯。在摄像头里,这次抓取看上去干净利落:手指合拢,纸杯抬起,手腕转向托盘。随后纸杯滑动了几毫米,控制器为了补偿而加大了握力,杯壁向内瘪了下去。整个失败过程都以高分辨率、高帧率被记录了下来,可几乎没有一处被真正看见,因为出问题的那些变量,指尖处的剪切力、最初几微米的滑移,从未落在任何一个像素上。

如今用于训练操作策略的数据,几乎全部来自摄像头。Open X-Embodiment 把数十个机器人数据集拼接在一起,它们共有的信号是 RGB 加本体感知。DROID 用多视角 RGB-D 把遥操作规模化。像 Ego-Exo4D 这样的第一人称人类语料,则细致地记录了双手从佩戴者视角看去在做什么。这些都是当下人人都在训练的 vision-language-action(VLA)模型的底料。它们也共享同一个盲点,而这个盲点恰恰对操作最要命:接触。

触觉不是可以事后再加的附赠通道,它承载着抓取的物理本质。RGB 测量的是从表面反射回来的光;而两个表面一旦相触,携带信息的变量就不再是光子,而是力。说得直白些:在接触密集的任务里,有用的信号恰恰在任务变难的那一刻离开了画面。

接触发生的那一刻,摄像头看不到什么

在接触前的那一毫秒之前,视觉表现出色。它定位物体、规划接近路径、判断被抓的是什么。然后三件事同时发生,而摄像头没有一件能拍好。

  • 遮挡。手指恰好合拢在你最关心的那一小块接触面上。接触界面此刻被形成它的那只手挡住了。
  • 力不是视觉量。轻轻托住和用力捏碎,从外部看可能一模一样。你无法从像素里可靠地区分 5 N 与 15 N,而刚度,也就是让你分辨纸杯与铁罐的那个属性,在有东西发生形变之前始终不可见。
  • 滑移又快又小。初始滑移,也就是完全滑脱之前的局部微滑,是一个亚毫米、短于十分之一秒的事件。等它在视频里看得见时,物体已经在动了。

力数据编码的物理量

视觉安静下来的地方,接触感知却响亮起来。触觉或力通道报告的,正是真正决定抓取是否稳固的那些量:

  • 法向力与剪切力,以及绕接触点的力矩,三者共同决定物体是留在原处,还是从手中转脱。
  • 初始滑移,它让控制器把握力抬高到刚好够用,就像人在纸杯开始下滑后大约十分之一秒内做出的调整。
  • 柔顺度,以及低于光学分辨率的纹理:表面有多硬、会形变多少、是滑还是涩。

采集这些量的硬件真实而多样。GelSight、DIGIT 这类基于视觉的触觉传感器,用一层软胶加一枚微型摄像头,把接触面变成高分辨率的形貌图。手腕处的力矩传感器读出施加在整只手上的六轴力旋量。Toyota Research Institute 的软"气泡"夹爪,把可形变触觉感知从实验室里的稀奇玩意,变成了操作栈中承重的一环。手腕处的力矩回路运行在接近 1 kHz 的频率,比典型的摄像头流快上一个数量级;而基于视觉的触觉传感器则以视频帧率采样,因为它们的感知元件本身就是一枚摄像头。

视觉告诉机器人该往哪里伸手,只有接触才能告诉它这一伸是否奏效。

两种模态,并排来看

摊开来看,这两条通道并不是竞争对手。它们是互补的,在同一个动作的不同瞬间各自达到峰值:视觉在接触之前,力在接触之中。

针对同一次抓取,各模态揭示了什么
RGB 视频接触与力感知
物体位置与形状局部,仅限触到之处
握力大小直接测得
初始滑移基本没有直接,短于 100 ms
材料刚度只能推断,不可靠接触即测
手指遮挡期间的状态丢失保留
典型采样率数十 Hz数百至约 1000 Hz

为什么接触数据几乎不存在

如果力如此关键,为什么大型训练集里几乎见不到它?答案既平淡又结构性:接触数据难采集,更难标准化。

摄像头便宜、可互换、说着同一种格式。触觉传感器一样都不占。形态五花八门且互不兼容,会漂移、会磨损,标定要逐台进行,而且根本没有一套共享的模式来规定:跨两个实验室,一次"触觉读数"到底算什么。作为现代采集主力的遥操作装置,也很少在视频之外同步输出经过标定的力。而规模最大的人类演示来源,也就是第一人称视频,则完全没有力的真值:Ego-Exo4D 知道手在哪里,却不知道手感受到了什么。

有少数数据集在对抗这一现状。RH20T 有意让多视角视觉与力矩、音频配对,好让策略学到一次接触事件听起来、摸起来是什么样,而不只是看起来如何。在模型一侧,Toyota Research Institute 的 large behavior modelsPhysical Intelligence 的灵巧操作工作,都把丰富的闭环接触行为当作目标,而非事后补充。但这些仍是例外。默认语料至今压倒性地偏视觉,这意味着许多策略悄悄学会了从视觉先验去接触,而这一猜,遇到新物体、新材料或一次糟糕的抓取就会崩掉。

把力放进训练集之后会变什么

接触也是仿真最吃力的地方。刚性接触、摩擦与形变是任何物理引擎里最不可靠的部分,因此纯在仿真中训练的策略,继承的是一套与真实世界对不上的接触模型。真实、经过标定的力数据,就是把这些策略拉回现实的锚点;而只要有数据可喂,像 NVIDIA 的 Isaac GR00T 这样的 VLA 主干,本就有能力把这种信号吸收进去。

回报恰恰体现在那些让纯视觉系统出丑的任务上:插插头、压接连接器、拿捏一个会变形的袋子、使用那种靠手感而非眼睛来反馈的工具。这些并非边缘情况,而是一个人形机器人在家庭或仓库里被要求去做的大部分活儿。

机器人里的摄像头问题,基本是靠规模解决的。触觉问题不会这样被解决,因为解决它的数据并不躺在互联网上等着被抓取。它必须被有意地采集,把力测出来,并与其余一切对齐。今天就把接触当作一等模态来对待,而不是等视觉管线跑通后再补上一路通道的团队,才是一年后机器人还稳稳端着那只杯子的团队。

tactile-sensingforce-datamanipulationrobot-datasetsmultimodal

来源