动作捕捉套装与纯视觉采集之争

动作捕捉套装锁定指尖精度,无标记视觉在真实环境中规模化。本文讲清人类采集中真实的成本与精度权衡。

阅读约 6 分钟

基于标记点的动作捕捉套装,能在一圈红外相机环绕的房间里,以每秒六十次的频率把指尖锁定在远小于一毫米的精度内。它也要花二十分钟才能穿好,需要一间标定过的摄影棚,还会让穿戴者动起来像个身上贴着四十个反光标记的人。仅靠视觉的采集则用普通相机、身上什么都不穿,从像素里读出同样的动作,只是精度只有前者的一小部分。这道差距,就是整场争论的核心。

对人类示范数据而言,这是道路上的第一个岔口。你是给人装上传感器,还是从像素中推断一切?答案塑造着成本、规模、真实感,而最重要的是,双手能被还原得多好。

装备套装能给你什么

在身上装上标记点或惯性传感器,你就得到真值。光学系统把标记点位置三角化到亚毫米精度。惯性套装融合陀螺仪和加速度计,直接报告关节角度,即使某个肢体对所有相机都不可见也照样输出。其结果是一具干净、高帧率的骨架:无需猜测就能重定向到机器人上的关节角度。

帧率在这里很关键。一套好的套装以 240 Hz 输出,快到足以捕捉真实操作中迅速的反向动作,之后你可以把它降采样到 30 Hz 的输出用于训练。像 Ego-Exo4D 这样的多视角项目,正是把自我视角视频与标定过的外部相机配对,以恢复这种高保真的姿态。

账单会在别处到来。套装需要时间穿戴和标定。光学装置把你绑在摄影棚里。惯性系统会漂移,且厌恶磁场杂乱。而每一个标记点都是对自然行为的一点小小的税,因为一个意识到自己穿着套装的人,动起来并不完全像一个在家洗碗的人。

精度不只关乎空间。套装在每个时间步都报告完整的关节状态,位置以及往往还有速度,这正是策略所需、而相机看不到的本体感受信号。视觉给你手看起来在哪里。套装给你关节实际在做什么,包括那些从不表现为可见运动的微小预紧和颤动。

无标记的纯视觉采集能给你什么

纯视觉采集把每一个权衡都翻了过来。没有任何东西要穿戴。你架好相机、录制,事后再从图像里估计姿态。这让它便宜、部署快,并且能用在摄影棚永远塞不进去的真实厨房和工作间里。最大的自我视角人类数据集 Ego4D 正是出于这个原因采用纯视觉:它能在真实环境中扩展到数千小时。

你采到的行为也更自然。没有人会去想自己的标记点,因为根本没有标记点。人们的行为更接近他们真实的样子,而这正是从人类示范中学习的全部意义。

你放弃的是精度,尤其是在遮挡之下。一只转离相机的手就成了一个猜测。单一视角下深度是有歧义的。快速运动会模糊。现代姿态模型很强,但它们依然是在套装本会测量的地方去推断,而推断恰恰在操作最在意的那些杂乱、近接触的瞬间悄悄失败。

差距在缓慢缩小。多相机装置和学习到的先验把无标记手部追踪推进了很远,对粗略的全身运动往往已经够用。但误差并不均匀。它集中在手指、遮挡之下,以及快速接触之中,而这些恰是操作策略正试图学习的瞬间。

表 1:人类采集中,装备套装与无标记视觉的对比
维度动作捕捉套装纯视觉(无标记)
关节精度亚毫米到低毫米较粗,依赖视角
手指细节直接测量常被推断、自遮挡
抗遮挡能力高(借助惯性)
每次场次的准备数分钟穿戴与标定架好相机即录
行为自然度被装置削弱
规模与成本昂贵,受限于摄影棚便宜,可在真实环境使用

隐藏的变量是双手

全身姿态是容易的部分。操作活在手指里,而手指正是两种方法分歧最剧烈之处。一套带手套的套装直接记录每一个手指关节,即便在抓握中、手掌包裹着物体时也是如此。视觉则必须从一张图像里重建二十多个手指自由度,而其中一半被所握的物体自遮挡了。

这就是为什么一个数据集在身体尺度上看起来很丰富,却在真正要紧的地方很单薄。如果手指是猜出来的,富接触技能就会继承这份误差。

灵巧的硬件只会让这一点更尖锐。随着机器人手获得更多手指和自由度,你训练所用手指数据的精度,就成了这只手能学会做什么的上限。

对操作数据而言,真正要紧的精度不是手腕在哪里,而是接触发生的那一刻每根手指在做什么。

不选边站地构建示范语料库

套装对视觉是个虚假的二选一。严肃的采集会把两者融合。无标记采集买来广度:许多人、许多家庭、许多小时,且便宜。一个装备核心买来深度:一小批高保真、被完全观测到的示范,用来锚定和标定其余部分。把两者交叉配准,便宜的数据便继承了昂贵数据的一部分可信度。

把人类动作重定向到人形机器人上,是 NVIDIA GEAR Lab research 关注的方向之一,而它只有在源头关节被准确测量的前提下才行得通。无论如何配比,元数据决定可用性。每条轨迹都需要记录其采集方法、标定和帧率,好让下游团队知道哪些关节是测量的、哪些是推断的。arXiv Robotics (cs.RO) 上的方法综述越来越多地把这种来源信息当作一等字段,而非脚注。

还有一个偏向刻意采集的同意与隐私维度。一场有知情参与者的摄影棚场次,比从公开网络上抓来的视频更易于治理,而由此产生的元数据,谁被记录、何时、在何种协议之下,会随数据一同流转。

所以套装和相机,单独来看都不是正确答案。套装确切地知道手做了什么,却难以扩展。视觉能扩展到整个杂乱的世界,却对手指只能猜测。真正能训练出灵巧策略的语料库,是那个用便宜视觉换覆盖、用装备核心换真值、并用细致元数据告诉买家哪个是哪个的语料库。

motion-capturemarkerlessegocentrichuman-demonstrationhand-tracking

来源