技能基元:利用可复用组件构建复杂的机器人任务

探讨模块化策略和技能基元如何解决机器人领域中的长时程任务难题,以及为什么我们的数据策略必须为此做出改变。

阅读约 6 分钟

观察一个人冲咖啡的过程。整个序列大约需要四分钟,包含数十个微动作:拿取杯子、调整方向、将其置于喷嘴下方、按下按钮、打开牛奶盒、倾倒以及搅拌。如果你试图将这整个序列作为一个单一轨迹来训练一个端到端的模仿学习模型,该模型几乎注定会失败。在四分钟的时程中,复合误差会呈指数级增长,导致机器人学家所说的“漂移问题”。

相反,人类看到的并不是一个单一的、四分钟的连续轨迹。我们看到的是离散且高度可复用的运动常规的组合。在现代具身智能中,我们称之为技能基元(skill primitives)。通过围绕模块化策略(modular policies)而不是单体端到端轨迹来构建机器人学习,我们可以大幅减少训练人形机器人完成复杂的、多步骤任务所需的人类演示数据量。

多任务瓶颈:为什么端到端方法会失效

端到端视觉-运动-语言模型(VLA)在短时程任务上表现出了令人印象深刻的零样本泛化能力。然而,当应用于工业或家庭工作流程中的长时程任务时,它们的可靠性会急剧下降。一个在单个子任务上拥有 90% 成功率的策略,在将五个子任务串联在一起时,其成功率会暴跌至 53% 左右。

这种失败主要是由于微小执行误差的累积造成的。当机器人在第一步中稍微算错了一次抓取,它进入第二步时就已经超出了其训练分布。由于缺乏在不同阶段之间进行清理、对齐或平稳过渡的机制,机器人会陷入永久性的混乱状态。行业正逐渐意识到单体模型对于物理世界来说过于脆弱,这一观点在 NVIDIA GEAR Lab research 的最新研究以及通用物理先验的发展中得到了印证。

通过将复杂的长时程任务分解为模块化策略库,我们可以在特定的技能基元(如抓取、插入或擦拭)上训练专用模型,并使用高层任务规划器来编排它们。这种由 Physical Intelligence blog 等公司倡导的方法,使得在数百个不同的高层工作流程中复用同一个“抓取”基元成为可能。

模块化策略将长时程机器人任务的指数级复杂度简化为了技能组合的线性问题。

定义技能接口

为了让技能基元在模块化架构中发挥作用,我们必须定义清晰的接口。技能基元不仅仅是一个原始的运动脚本,它是一个闭环策略,将传感器运动观测映射到动作,并受到特定启动和终止条件的约束。这种结构对于与 NVIDIA Isaac GR00T 等高级编排器的集成至关重要。

为了构建一个鲁棒的技能库,我们将基元分为三个不同的功能层。这种分类法确保了高层的语义推理能够清晰地转化为高频的关节控制。

表 1:模块化机器人策略中的技能基元分类
技能类别典型控制频率示例基元关键数据需求
富接触操作100-500 Hz轴孔装配、螺纹拧紧高频力-力矩特征数据
拾取与放置轨迹10-30 Hz触及、抓取、放置精准的 6-DoF 位姿估计和深度图
柔性物体处理20-50 Hz折叠衣物、倾倒液体连续的视觉反馈和触觉感知

这些类别中的每一个都需要不同风格的数据采集。例如,富接触的插入任务无法仅通过视觉演示来学习,它需要高保真的力-力矩特征来捕捉对齐表面时所需的微妙合规性,以避免损坏部件。这就是为什么像 Open X-Embodiment 这样的多模态数据集如此宝贵的原因:它们聚合了跨多种传感器模态的各种机器人行为。

组合的挑战:过渡与护栏

模块化机器人最难的部分不是训练单个技能基元,而是管理它们之间的过渡。如果机器人在完成“拾取”基元时,其夹爪稍微偏离了位置,接下来的“放置”基元可能就会立即失败。我们该如何弥补这些差距?

在任务组合中,目前主要有两种流派:

  • 显式状态护栏: 每个技能基元都有一个分类器,用于确定当前状态是否属于其“启动集”(即保证技能能够成功执行的状态集)。如果机器人处于该集合之外,则会触发恢复策略。
  • 隐空间混合: 高层策略输出连续的嵌入向量,以平滑地混合技能之间的过渡,从而在不产生突然停顿的情况下实现连贯、不间断的运动曲线。

这两种方法都需要对每个技能的物理边界有深入的理解。这意味着,当我们收集人类演示数据时,我们不能只捕捉成功的执行过程。我们还必须捕捉技能的“边界”,包括恢复行为、近乎失误的情况以及纠偏调整。

模块化策略对数据层的要求

向模块化策略的转变从根本上改变了我们对机器人训练数据的要求。从历史上看,像 Ego4D 这样的数据集主要关注人类日常活动的被动、第一人称视角视频。虽然这些视频对于语义理解极具价值,但被动视频缺乏训练闭环运动技能所需的精细物理遥测数据。

为了训练模块化策略,我们需要围绕技能边界进行显式结构化的数据。这意味着每一次演示都必须标有每个基元的精确开始和结束标记,并伴有高频的本体感受数据、触觉反馈和多角度视觉透视。如果没有这些结构化的元数据,将长时程演示分割成可复用的基元将成为一个棘手的标注瓶颈。

结论:通往泛化之路

我们无法通过在非结构化视频上训练越来越大的单体模型来实现通用人形机器人。物理世界过于复杂,物理交互的尾部效应也过于宽广。相反,未来的道路在于掌握可复用技能基元的组合。

通过将机器人能力视为物理动作的模块化库,我们可以构建更易于调试、训练更快且高度适应新环境系统。瓶颈不再仅仅是算力,而是我们为这些模块化架构提供高度结构化、多模态、第一人称演示数据的能力,这些数据是桥接模拟与现实缝隙的必需品。

skill-primitivestask-compositionmodular-policiesdatasetsphysical-ai

来源