观测空间与动作空间:那些安静的决定

你选定的动作空间与观测空间,决定了一份数据集究竟能教会什么。这是一份关于那些比机器人更长寿的安静决策的指南。

阅读约 6 分钟

两个实验室记录同一件家务:擦桌子。一个以 10 Hz 记录末端执行器位姿。另一个以 100 Hz 记录原始关节角度,外加腕部力。同样的技能,同一类机器人,然而它们的数据集却几乎无法互相训练对方的策略。差距不在任务本身,而在于观测空间与动作空间的选择,这个选择在一个下午里做出,却要用整份数据的一生去偿还。

这两个选择是一个机器人学习项目里最安静的决策。没有人会在挑定动作空间的那天写一篇博客。可正是这一挑,决定了什么能泛化、什么能与其它数据集合并、以及什么日后必须被丢弃。它值得比通常得到的多得多的斟酌。

这里说的“空间”是什么意思

观测空间是一个策略被允许看到的一切的集合:哪些相机、什么分辨率,再加上你纳入的任何本体感受与触觉通道。动作空间是一个策略被允许发出的一切指令的集合:关节目标、末端执行器运动、夹爪信号,以及每一项如何编码。两者都是设计决策,而不是关于这台机器人的客观事实。同一条手臂至少可以通过三种不同的动作空间来驱动,而每一种都会从完全相同的运动中,产出一份略有差别的数据集。同一段擦拭动作的关节位置日志、末端执行器位姿日志、以及 token 化日志,是三份不同的数据集,下游团队事后无法自由地相互转换。

动作空间的抉择

先从动作说起,因为动作空间是人们最容易低估的那一个。真实数据集里,主流选项就那么几种。

  • 关节位置。给每个关节一个目标角度。精确、与硬件绑定,几乎无法迁移到运动学不同的机器人上。
  • 关节力矩或速度。更底层,非常适合动态和富接触运动,也最不容易被干净地采集下来。
  • 末端执行器位姿。指定手应该在哪里,在某个坐标系里是绝对量。跨本体更可移植,代价是掩盖了手臂的冗余自由度。
  • 末端执行器增量。每一步指定手部位姿的一个微小变化。它是当下跨本体数据的宠儿,因为一个增量在很多条手臂上大体意味着同一件事。
  • token 化动作。把以上任意一种离散成 token,让一个语言式模型能够吐出,这正是许多视觉-语言-动作模型把控制嫁接到 transformer 上的方式。

这件事之所以如此要紧,原因在于汇集。Open X-Embodiment 这项工作不得不去调和数十个各自选定了自己动作空间的数据集,而其中大量的苦活,就是在不破坏含义的前提下,把它们翻译进一个共享的表示。DROID 则刻意押注于在一支庞大的遥操作队伍上保持一致的动作与观测格式,正是为了让它的数据能够组合。

常见动作空间,以及各自的代价
动作空间最适合弱点能跨本体迁移吗?
关节位置单台机器人上精确、可重复的运动锁死在那台机器人的运动学上
关节力矩或速度动态、富接触控制难以干净地采集与模仿
末端执行器位姿可移植的操作目标掩盖手臂冗余与自碰撞中等
末端执行器增量跨众多手臂汇集数据缺乏良好参考系时漂移累积
token 化动作视觉-语言-动作模型精细尺度上的离散化误差取决于分词器

观测空间的抉择

观测空间藏着同一类隐形的杠杆。三个子选择,包办了大部分的成事,或大部分的坏事。

选哪些模态

单独的 RGB 便宜,对粗略任务往往也够用。加上深度,你就帮到了几何。再加上本体感受与力,你才终于把人在插接时下意识使用的信息,交给了策略。像 RH20T 这样的数据集,正是为同时承载力与多视角视觉而构建的,因为擦拭或插接,仅凭单路 RGB 流几乎无法学会。

选哪个坐标系

腕部相机拍的图像,和三脚架拍的图像,教的是不同的东西。在机器人基座坐标系里表达的位姿,和同一个位姿在相机坐标系里的表达,在数据里并不可以互换。混用坐标系却不记录变换关系,是一份数据集悄悄变得不可用的最常见方式之一。

留多少历史

单帧是马尔可夫的,容易打乱。一小段帧窗口支持记忆和速度估计,却逼着你把序列保持完整。观测空间正是你为此下承诺的地方,无论你有没有意识到。这一步弄错了,你往往很晚才会发现:一个需要速度的模型,无法从采样间隔过大的帧里把速度还原回来。

你不是只选一次动作空间。你是为每一个将来会在这份数据上训练的模型而选,所以唯一稳妥的准则,就是挑那个丢弃得最少的表示。

为什么合并数据集这么难

所有这些,最终汇聚到这个领域数据供给里最难的那个问题:汇集。当两份数据集在动作空间、观测模态、坐标系或控制频率上各执一词,合并它们就不是一桩文件格式的杂务。它是一次语义翻译,可能悄无声息地扭曲机器人当时到底在做什么。像 NVIDIA 的 GR00T 这样一个策略基础,之所以能与众多机器人本体兼容,靠的正是选择那些能挺过这场翻译的表示。凡是表示有损的地方,合并就会悄悄注入噪声,而下游任何一次训练都无法把它清除。

这也是为什么控制频率应该被放进同一场讨论。以 10 Hz 采样的数据集和以 100 Hz 采样的数据集,差别不只在体量;慢的那个已经丢掉了富接触技能赖以生存的快速纠正。重采样能对齐时间戳,却无法凭空造出从未拍下的帧。

任务是容易的,空间是长久的

观测空间与动作空间看起来像管道工程,而这恰恰是它们危险的地方。它们被早早选定,由离硬件最近的那个人选定,并且锁死了此后每一个模型所能学到的东西。选一个狭窄的动作空间,你会得到一份干净的数据集,却会老化成一条死胡同。选一个丰富、参考系明确、时间对齐的表示,你会得到一份数据,在其上的策略架构不断更替时,它仍持续产出回报。任务是容易的那部分。你把它记录进去的那个空间,才是那个会长久留存的决定。

action-spaceobservation-spacerepresentationcross-embodimentdatasets

来源