面向机器人的自监督学习

自监督学习让机器人从无标签的交互中学习,而不必依赖昂贵的人工标注;以及为什么自我视角视频是它天然的契合对象。

阅读约 5 分钟

一个幼儿学会用杯子倒水,没有谁递给她一份带标签的数据集。她观察、尝试、洒出来、再调整。没有人给画面做标注,也没有人记下关节力矩。监督信号就烘焙在世界本身之中:洒在地上的水是一个标签,倒进杯里的水也是。机器人领域花了多年,试图通过人工标注去买到等价的信号,而这条路一直既慢又贵,且无法扩展到物理世界的杂乱。

自监督学习是那个逃生舱口。你不再花钱请人给数据打标签,而是设计一个让数据给自己打标签的任务,让模型免费地学到世界的结构。对机器人而言,每一个标签都意味着一个人在看视频、或一台机器人在消耗硬件,因此这一转变不是锦上添花,它几乎是扩展规模的前提。

而它恰好异常契合某一类数据:第一人称(egocentric)视频。

让数据给自己打标签

自监督背后的诀窍是“预置任务”,一道答案已经藏在数据里的谜题。遮住视频帧的一部分,让模型把它补全;打乱片段的顺序,让模型判断哪个在前;给出两帧,问是什么动作把场景从一帧带到了另一帧。这些都不需要人工标注者,而解开它们会迫使模型建立起能刻画外观、动态与因果的表征。

不同的预置任务教的东西不同,这个选择并非无关紧要。

表 1:自监督预置任务,以及各自教给机器人模型什么
预置任务免费的监督信号表征学到什么
掩码预测重建被遮住的像素或图块外观与空间布局
时间对比同一片段对不同片段时间连贯性、缓慢变化的特征
未来预测预测接下来的帧或状态动态,以及一个粗略的前向模型
逆动力学预测两帧之间的动作与动作相关、可直接用于控制的特征
视频-语言对齐把片段与其旁白配对场景与物体的语义落地

机器人研究者最在意的是逆动力学那一行。如果一个模型能猜出把世界从一帧带到下一帧的动作,它就学到了对控制直接有用的东西,尽管从没有任何动作被标注过。

为什么自我视角视频是天然的基底

自监督需要原始数据,而数据越像机器人将要看到的东西,迁移就越好。自我视角视频出于三个原因近乎理想。视角与头部或腕部摄像头相匹配,因此预训练分布不必与部署分布相互拉扯;双手就在画面里,这意味着数据里满是操作策略必须掌握的那种手与物体的接触;而供给量极其庞大:人们整天都在产生第一人称的画面。

自我视角视频并非白捡的便宜。摄像头随着每一次转头而晃动,那只本要向它学习的手,又常常挡住最要紧的接触,而一段普通片段里根本没有力这个通道。自监督能从中学到很多,但它学到的是像素中的相关性,而机器人需要知道的一些东西,永远不会以像素的形式出现。

大型第一人称语料正是为此而建。Ego4D 汇集了数千小时的日常第一人称活动,而它的后继者 Ego-Exo4D 为同一批动作加上了同步的第三人称视角,让模型可以同时学到一项任务从内部和从外部看起来是什么样。那种成对的结构本身就是一种免费的监督信号。

机器人领域最稀缺的资源不是算力,也不是机器人。是带标签的交互,而自监督正是让你不再那么需要它的办法。

动作鸿沟,以及如何跨过它

这里有一个诚实的问题。被动的人类视频展示的是发生了什么,而不是那个人命令自己的肌肉去做什么,可机器人需要的是动作。看,并不等于做。弥合这道鸿沟,是该领域活跃的前沿。

这道鸿沟不仅仅在于缺少动作标签。人的手有五根手指和一个手腕,两指夹爪却没有,因此即便完美地推断出了人的动作,它也未必能映射到机器人的身体上。重定向,再加上用少量真实机器人数据做接地,才补上这最后一步。

领先的思路是学习隐动作:用逆动力学从无标签视频中推断出一个抽象的动作空间,在海量视频上预训练,然后用少量真实机器人数据把这些隐动作接地。NVIDIA GEAR Lab research 关于通用机器人模型的工作就这样使用人类与跨本体视频,而 Google DeepMind blog 的世界模型研究,则把“以预测为预训练”的想法推向一个相关的方向。反复出现的模式是:在廉价的无标签视频上预训练,再把稀缺的机器人数据只花在真正需要的地方。

当标签不再是瓶颈,会发生什么

有监督学习的规模,取决于你的标注预算;自监督学习的规模,取决于你能采集多少原始数据,这是一条截然不同、也友好得多的曲线。面向控制的一批奠基性自监督方法,其中不少出自 Berkeley BAIR blog 及其合作者,确立了这样一点:对操作有用的视觉表征,可以在没有任何奖励或动作标签的情况下学到。

这重新框定了整个问题。问题不再是你负担得起标注多少段示范,而是你能采集到多少多样、相关的交互。数量与覆盖度,开始比整齐的标注更重要。

结论

机器人不会靠打标签走到通用能力;世界上既没有那么多标注者,也没有那么多机器人工时。道路要穿过自监督:尽可能多地从会给自己打标签的数据中学习,把昂贵的带标签交互留给最后一公里。自我视角视频是让这一切变得可行的基底,前提是这个领域在采集它时,带上那些能把“看”变成机器人可以据以行动之物的物理通道。

self-supervised-learningunlabeled-dataegocentricpretrainingdatasets

来源