手势估计:从第一人称视频中读取手指动作

探讨如何从第一人称视频中提取 21 个关键点坐标,从而解决双手指尖精细操作中的人机手部动作重定向难题。

阅读约 5 分钟

指尖上的运动学失配

观察人类操作员剥葡萄皮或穿针引线。人类的手拥有 27 个自由度,能够以极度流畅的动作完成这些任务,而这背后其实隐藏着巨大的计算挑战。如果我们想训练人型机器人来复制这种灵活性,首先必须捕获这些动作。但是,当我们使用头戴式相机记录人类演示者的动作时,我们得到的不是关节角度,而是像素。

这就是第一人称(第一人视角)数据采集的核心挑战。与使用笨重、具有力反馈的手套或虚拟现实控制器的遥控操作设置不同,第一人称视频捕获保留了自然的人类动力学。它不会引入硬件接口的人为延迟或物理限制。然而,它将负担转移到了计算机视觉上。为了将原始像素转化为 Vision-Language-Action (VLA) 模型的可用训练数据,我们必须可靠地从单一、通常模糊的第一人称视角中提取高保真的手部姿态估计(hand pose estimation)。

连接原始像素与机器人控制的桥梁就是手势估计:识别和跟踪手部 keypoints(关键点)空间坐标的过程。没有这座桥梁,第一人称视频就只是图像序列。有了它,视频就会变成丰富的轨迹数据集,可以重定向到任何机器人抓取器,从简单的平行夹爪到极其复杂的五指手。

手部几何学:21 个核心关键点

在计算机视觉中,人类的手通常被表示为一个包含 21 个 keypoints 的结构化图。该模型包括 1 个手腕关键点和每个手指各 4 个关键点(MCP、PIP、DIP 和指尖关节)。从 2D 第一人称视频流中解析出这 21 个点在 3D 空间中的位置是极其困难的。相机在不断移动,手部移动速度快到足以产生运动模糊,而且在 manipulation(操作)任务中物体经常会遮挡手指。

传统方法依赖深度传感器,但这些传感器在室外光线下表现不佳,且无法捕获薄的、反光的或透明的物体。现代管线利用了在诸如 Ego4DEgo-Exo4D 等大规模数据集上训练的深度神经网络。这些数据集提供了多样化的、真实世界的第一人称镜头,用于训练强健的关键点估计器,使其能够推广到不同的光照条件、肤色和手部形状。

自遮挡的挑战

第一人称手势估计中最严重的障碍是自遮挡。当手抓握工具时,手指自然向内弯曲,隐藏了我们需要跟踪的关键点。为了克服这个问题,现代估计器不将关键点视为孤立的像素点。它们将手建模为具有严格物理约束的运动学骨架。如果食指指尖消失在咖啡杯后面,网络会根据可见的手腕、指关节以及已知的人类关节旋转限制来推断其位置。

重定向管线:从人类到机器人

一旦我们提取了 21 个手部关键点的 3D 坐标,就会面临第二个主要障碍:重定向。人类的手与机器人的手并不匹配。机器人的手可能具有不同的连杆长度、更少的手指或不同的关节限制。例如,由 1X Technologies 等公司开发或在 NVIDIA Isaac GR00T 中进行模拟的灵巧手,需要精确的映射来将人类关节角度转化为机器人电机指令。

重定向通常被公式化为一个优化问题。我们通过最小化对应功能点(如指尖)之间的距离,将提取的人类关键点映射到机器人运动学模型(由其 URDF 文件定义)。这种优化必须快速运行,通常需要达到 30 Hz 到 100 Hz,以确保在采集过程中可以实时验证捕获的数据。

手部姿态跟踪方法对比
方法所需硬件精度(手腕/手指)自遮挡鲁棒性自然人类动力学
主动标记点跟踪红外相机、物理标记点高(低于 2mm)差(标记点易被遮挡)低(标记点会改变抓握感)
数据手套外骨骼/传感器手套中等偏高极佳(无光学依赖)低(笨重,限制触觉)
单目 RGB(基于 Ego4D 训练)标准 RGB 相机中等(3-5mm)中等偏高(通过时序先验)高(零物理束缚)
物理 AI 的最终目标不是精确模仿人类的手部轨迹,而是理解人类手部的功能意图,并将该意图映射到机器人独特的运动学结构上。

时序先验在操作中的作用

单帧手势估计不足以进行复杂的 manipulation。如果网络独立处理 30 fps 视频的每一帧,估计出的手部将会剧烈抖动,使得数据无法用于训练策略。为了解决这个问题,最先进的管线使用时序模型(例如循环神经网络架构或 Transformer)来平滑轨迹。通过分析手部在过去十帧中的移动方式,系统可以以更高的置信度预测其当前状态,即使在快速动作或严重遮挡期间也是如此。

在为具身智能物理 AI 模型构建大型数据集时,这些时序模型至关重要。包括 NVIDIA GEAR Lab researchStanford IRIS lab 在内的研究机构都强调,干净、时序一致的轨迹数据是训练稳定灵巧操作策略的最重要因素。

灵巧操作模型的未来之路

随着具身智能机器人从简单的移动转向复杂的真实世界交互,重点必须转移到手部。如果我们想将训练数据规模扩大到数百万小时,就不能仅仅依赖低维度的遥控操作。我们需要利用现有的海量人类视频库,以及我们可以使用简单的便携式相机设备捕获的数百万小时的新视频。

通过改进手势估计算法,使其在复杂的日常环境中可靠运行,我们释放了将人类动作直接转化为机器人训练数据的方法。这座桥梁由关键点构建,而物理 AI 的未来正写在指尖之上。

hand-pose-estimationdexterous-manipulationkeypointsretargetingphysical-ai

来源