什么是机器人策略?从观测到动作

机器人策略是从观测到动作的映射。看输出频率、动作格式、记忆与确定性如何决定你必须采集哪些数据。

阅读约 6 分钟

把一台人形机器人身上的营销话术剥掉,正中心只剩下一个对象:一个函数。它接收机器人此刻感知到的东西,返回电机下一步该做什么。机器人学家把这个函数称为策略(policy),而一个机器人学习技术栈里几乎每一个重要决策,暗地里都是关于策略形态的决策。

你可以无视策略,照样做出一个示范。但你无法一边无视它,一边又搞懂:为什么一份数据集能训出鲁棒的技能,而另一份更大、更贵的数据集却只训出脆弱的技能。策略是数据与行为相遇的地方,所以它是最合适的起点。

这篇文章会尽量朴素地定义策略,然后说明它的形态如何反向沿管线上溯,决定你必须采集什么。

观测进,动作出

策略的内核是一个映射。喂给它一个观测,也就是机器人当前对世界的视角,它返回一个动作,也就是驱动身体的指令。把这个循环每秒跑上几十乃至几百次,你就得到了行为。其余的一切,神经网络、训练目标、数据集,存在的意义都只是为了产出这个映射的一个好版本。

有两个细节让这个定义变得有用,而不只是空话。第一,什么算作观测,是一个选择:一台相机的像素,还是像素加关节角度加接触力。第二,什么算作动作,同样是一个选择:一个目标关节位置、一个末端执行器位姿的变化量,或是来自某个学习得到的词表的离散 token。像 LeRobot 这样的工具包在其数据模式中把这些选择显式化,这是一个好迹象,说明这个领域如今开始认真对待它们。

说清楚策略不是什么,也会有帮助。它不是一份提前排好的计划,也不是一段固定的脚本。好的策略是闭环的:它在每一个时钟节拍上重新读取世界,能对滑落的杯子或卡住的插销做出反应。正是这份反应性,让从静态视频里做模仿变得困难,也让你喂给策略的观测,必须来得足够快才有意义。

策略有形态,而形态自有后果

并非所有策略都是一个模子刻出来的,而这些差异并不只是表面文章。有四个维度最为关键。

输出频率

一个以 10 Hz 输出的策略,和一个以 200 Hz 输出的策略,是两种完全不同的动物。慢的那个可以依赖一个笨重的视觉骨干,从容地做规划。快的那个则必须足够轻,才能在个位数毫秒内闭合一个控制环。富接触技能通常需要那个快环,而这个要求会一路回溯到:你必须以多快的频率去采集。

动作表示

绝对关节位置、末端执行器增量、以及 token 化动作,各自意味着一份不同的数据集和一套不同的泛化故事。末端执行器增量比原始关节指令更优雅地跨机器人本体迁移,一旦你试图跨本体汇集数据,这一点就立刻要紧,Open X-Embodiment 正是这么发现的。

记忆

马尔可夫策略只看当前这一帧。带历史的策略能记得自己已经拿起了螺丝、此刻正拿着它。记忆为你换来长时程行为,代价是数据里要有干净、时间连贯的序列,而不是被打乱的单帧。

确定性

一个回归到单一动作的策略,会把两个同样好的选项平均成一个糟糕的折中。一个生成式策略,无论是扩散模型还是 token 采样器,都会把这些选项分开保留。这个选择决定了:你的数据里能不能包含完成同一任务的多种有效方式,还是必须被过滤到只剩一种。在操作中这一点反复出现:抓一只杯子有很多种好抓法,而一个被迫选出单一平均抓取的策略,常常会伸向两种抓法之间的空隙。

一个策略设计选择如何反向回到采集要求
设计选择常见选项对数据的要求
输出频率10 Hz 规划、200 Hz 控制以不低于控制频率采集,并精确打时间戳
动作表示关节位置、末端执行器增量、token所有示范帧对齐、标定一致
观测模态RGB、加深度、再加本体感受与力每种模态同步到同一时钟
记忆马尔可夫,或历史与循环完整的序列,而非打乱的帧
确定性回归,或生成式允许每个任务保留多种有效解

用策略这面镜子去读真实的技术栈

用这种视角去看当下的系统,它们就更容易比较了。NVIDIA 的 GR00T 是一个意在适配众多人形机器人的基础策略,因此它偏向以末端执行器为中心的动作和广泛的预训练。Physical Intelligence 的 pi0 与 Toyota Research Institute 的 大型行为模型,都押注于从庞大而多样的示范集上做克隆。共同的线索是:每个项目最核心的设计决策,也就是它策略的形态,决定了它必须去采集的数据的形态。近期 arXiv 上的许多机器人学习工作,读起来就是一场争论:哪一种策略形态,最能回报它所要求的数据成本。

用榜单分数去比较这些系统,其实说明不了多少,因为它们很少在同样的硬件上跑同一个基准。用策略形态去比较,却能说明很多:它预示了每个系统对哪种数据最饥渴,因而也预示了每个系统会在哪里难以扩展。

策略是一个赌注,赌的是多少信息足以选出下一个动作。数据集就是这个赌注的证据,而再多的训练也无法补上采集从未记录下来的证据。

小小的定义,巨大的后果

问机器人策略是什么,诚实的答案很小:一个从观测到动作的函数。问它的形态会带来什么,答案几乎就是整个领域。输出频率、动作表示、记忆、确定性,这些都不是实现细节。它们是那些在第一步梯度更新之前,就决定了你的数据必须包含什么的问题。先把策略的形态在脑子里想清楚,数据要求就不再是一个谜,而开始变成一份规格说明。这正是这层抽象安静的回报:给映射命名,钉住它的形态,关于数据的争论就不再原地打转。

robot-policyobservationactionvlacapture

来源