接触密集型操作对数据提出了什么要求

力和触觉信号,而非像素,决定着接触密集型操作。为什么 RGB 永远给不了这些信号,以及为什么触觉数据才是机器人基础模型真正的瓶颈。

阅读约 6 分钟

看机械手去夹一颗熟透的草莓。摄像头把靠近的过程拍得很干净:手指张开,果实落在画面中央,夹爪下压。可指尖一旦触到果肉,最关键的那些像素就消失了,接触面恰好被正在做出接触的手指挡住。到底是停在稳稳一握,还是继续合拢直到果肉破裂,这个决定发生在几毫秒的窗口里,依据的是摄像头从未记录的一路信号:力。

对于开阔空间里的抓取与放置,RGB 已经接近够用。它能报告物体在哪里、朝向如何、夹爪该去哪。它报告不了的,是用多大的力。机器人一旦开始按压、擦拭、插入、旋拧,或对抗阻力去拉,起决定作用的变量就从几何转向了力学,而力学不发出光子。这正是接触密集型操作正中央的盲区,靠更高分辨率或更大的 vision transformer 都补不上。

过去三年的机器人学习大多建立在视觉和关节位置之上,因为大型数据集里装的就是这些。Open X-Embodiment 把 20 多个实验室的演示拼在一起;DROID 把操作数据的采集推广到大量不同的场景与楼宇。两者都以视觉为绝对主体。作为起点这很合理,作为终点则远远不够。本文要谈的,是接触密集型工作对训练语料到底提出了什么要求,以及为什么力和触觉通道是承重结构,而不是可选项。

摄像头在哪里失明

有三种失效反复出现。第一是遮挡:在接触发生的那一刻,机械手本身盖住了接触界面,图像中信息量最大的区域恰恰是你看不到的那一块。第二是延迟。可见的形变滞后于造成它的力,于是靠像素训练出来的策略,是在力学事件之后、而非之中作出反应。第三是歧义:一个静置在夹具里的刚性零件,和同一个零件以 30 牛顿的力顶在一个没对准的孔上,在很多帧里看上去一模一样。视觉报告的是力的后果,既慢又间接。它报告不了力本身。

这些都不是换个更好的摄像头能解决的。深度能帮你抵达表面,可一旦表面被触到、被遮挡,它就哑了。更高的帧率能缩小延迟的差距,却永远说不出力的大小。你可以在事后给一颗被压烂的草莓打标签;但你无法从任何一帧 RGB 里,还原出那段 20 毫秒、决定它命运的握力上升过程。

接触密集型到底指什么

接触密集型任务有一个共同签名:成败取决于在一连串接触的建立与断开中调节力,而且往往处在视觉系统分辨不出的公差之下。插销与连接器的对插。擦拭和刮削表面。切割。叠布。把瓶盖拧上瓶口。让齿轮啮合。Toyota Research Institute 明确表示,它的 Large Behavior Models 瞄准的正是这种灵巧、重接触的场景;Physical Intelligence 也展示过在叠衣服这类任务上的通用策略,那里的物体会在手下不断改变形状。

这些都不是边角案例。它们恰恰是大部分有经济价值的工作:装配、布线走线、食品处理、包装、个人护理。共同的线索是:几何把你带到第一次接触,之后的一切都是力学。

RGB 永远给不了的信号

问题不在于视觉弱,而在于每一路通道都有自己的领域,而力和触觉覆盖的,正是接触密集型价值所在的那个领域。下面这张表刻意直白地标出:每一种模态在哪里不再有用。

各类传感通道擅长记录什么,又在哪里失灵
通道擅长记录原生速率(数量级)盲区
RGB 视频物体身份、位姿、场景布局30-60 fps力的大小、接触状态、打滑起始
深度几何形状、到接触点的距离~30 fps首次接触之后、一旦被遮挡的一切
关节本体感觉手臂构型、总体负载100-1000 Hz指尖级的力、局部打滑
腕部力/力矩净接触力旋量、插入阻力~500-1000 Hz力作用在手的哪个位置
指尖触觉局部压力、切向力、初始打滑100 Hz 到低 kHz整体场景、物体身份
一个只“看见”过接触的策略,感觉不到自己何时用力过猛。等到草莓在画面里明显被压烂,标签已经迟了三帧。

为什么大型数据集低估了触觉

这种稀缺是结构性的。Ego-Exo4D 以及更早的 Ego4D 采集了数千小时的人类活动,是一份出色的第一人称视觉语料,但都来自头戴摄像头,手部几乎没有经过标定的力。Open X-Embodiment 和 DROID 把视觉与本体感觉配对,而本体感觉报告的是手臂构型,而不是指尖接触。RH20T 是少数刻意把多视角视觉与力/力矩、触觉读数配在一起的大型数据集之一,这正是它显得突出的原因。结果是:整个领域拥有一份庞大的视觉语料,以及一份稀薄、零碎的触觉记录。

这很重要,因为模型只能从数据里真正含有的通道去学。以视觉为主的语料,养出的是形状像视觉的策略。再怎么扩大规模,也无法把一个从未测量过力的数据集,变成一个能教会力的数据集。

好的接触数据需要什么

把触觉记录好,比装个传感器难得多。有四条要求,把一份可用的接触语料和一份噪声语料区分开来。

  • 速率。力/力矩和触觉事件在数百赫兹到一千赫兹的量级上展开,而视频只有 30-60 fps。采集必须是真正的多速率,而不是把力降采样去迁就摄像头。
  • 标定。以原始传感器计数表示的触觉读数几乎没用。它必须映射到物理单位,也就是以牛顿计的压力与切向力,否则一个实验室的数据无法迁移到另一个实验室的机器人上。
  • 同步。1 kHz 的力和 30 fps 的视频,只有在时间戳对齐到一帧以内甚至更好时,才能一起教会模型。一次打滑事件和它周围的像素,必须指向同一个瞬间。
  • 工况覆盖。有意思的信息藏在转变里:接触前、接触建立、稳定保持、初始打滑、松开。只采样稳态的数据,恰好漏掉了策略最需要的那些时刻。

架构这一侧已经为触觉做好了准备。Gemini Robotics、NVIDIA GR00T 和 Physical Intelligence 的 π0 都是多模态策略,原则上都能以力和触觉数据流为条件。它们缺的不是容量,而是经验:那种把“该用多大力”这份来之不易的知识写进数据、而不是连同被遮挡的像素一起丢在剪辑室地板上的演示。把力记录下来,接触密集型自主就不再是一段演示,而成为一个你可以拿来训练的分布。

contact-rich-manipulationtactile-dataforce-sensingrobot-learningmultimodal-data

来源