什么才算一段好的示范?

并非每段示范都能教会机器人。本文拆解单段示范的质量维度,说明坏示范为何会毒害模仿学习,以及它们如何层层放大。

阅读约 6 分钟

两个人录制同一段示范:拿起一个马克杯,放到杯垫上。其中一段录像让策略变得更好,另一段却悄悄让它变差。任务相同、机器人相同、帧数也相同。差别在于质量,而示范的质量并不是单一属性,而是好几项,每一项都可能单独出问题。

机器人学习花了好几年追逐规模:更多小时、更多轨迹、更多遥操作。规模确实重要,但一大堆平庸的示范,训练出的策略可能比一小批干净示范还要差。行为克隆会忠实地模仿它所看到的一切,包括错误。于是整个领域底层的问题朴素得令人意外:什么才算一段好的示范?

策略会模仿,因而继承你的习惯

行为克隆把观测映射到动作。它并不知道你的哪些动作是熟练的、哪些是马虎的。如果你遥操作时的抓取犹豫了一下,模型就学会犹豫。如果你过冲之后再纠正,它会把过冲和纠正当成同一个连贯动作一起学下来,并且原样复现。这正是模仿学习的核心:示范既是老师,也是天花板。Physical Intelligence blog 与开源的 Hugging Face LeRobot 反复印证同一条经验:策略质量与示范质量的关联,远比与数据集规模的关联更紧密。

这里还有一个更隐蔽的陷阱:一段示范可以成功,却依然教错了东西。如果你在三次落空之后靠运气抓住了杯子,策略就会把那三次落空也当成配方的一部分学下来。成功是必要的,但远远不够。

单段示范的质量维度

把“质量”拆成可以逐项检查的维度,会更有用。下面这些维度里,任何一项塌了,都足以让一段示范从资产变成负担。

评价单段机器人示范的质量维度
维度好示范的样子出问题时的样子
成功任务干净地完成失败,或勉强蒙对
最优性轨迹平滑、直接抖动、绕路、来回犹豫
一致性同类任务采用同一策略每次做法都不一样
覆盖度起始状态与物体各有变化同一摆位反复重复
模态完整力、深度、本体感受同步齐全缺通道或时间戳错位
动作对齐指令与所见严格同步遥操作延迟导致配对错位

这些维度并不是相互独立的旋钮。有覆盖度而无一致性,得到的是噪声;有一致性而无覆盖度,得到的是一个只背下某个姿态的策略。真正的功夫,在于一段接一段、一个操作者接一个操作者地同时守住其中好几项。

“模态完整”值得单独提个醒。一段缺了力通道的示范,并不只是“信息少一点”的示范;对富接触任务而言,它是会误导人的,因为策略会学着到达正确的位姿,却对自己按了多大力浑然不觉。有深度而无力、有力却不对齐、有画面却无时间戳:每一处缺口,都会让这段示范在某一类任务上从“不完整”变成“实打实的错”。一个采到了却从未同步的模态,往往比根本没采的还糟,因为它看上去很可信。

为什么质量会累积放大

坏示范的伤害不是线性叠加的。一个在干净示范上训练、偶尔犯错的策略,会慢慢漂移出它见过的状态;而混入的坏示范,会以不可预测的方式把动作分布撑宽。稀有技能最容易受害:某个技能可能只有几十段示范,只要其中几段带着延迟或错误标注,它们就足以主导这个技能被学成的样子。近重复示范则会虚增数据量,让语料看起来大了十倍,实际却几乎没教任何新东西。这正是像 DROIDOpen X-Embodiment 这样的语料如此看重统一采集协议的原因。协议不是官僚主义,而是防止某个操作者的坏习惯悄悄改写整个共享数据集的那道闸。

事后过滤的作用,往往没人们指望的那么大。你可以扔掉明显的失败,但真正隐蔽的伤害,来自那些“用糟糕策略却蒙对了”的示范,它们在自动过滤器眼里毫无破绽。一次抖动、犹豫却仍然放好了杯子的抓取,能通过每一项成功检查,却照样教会策略去犹豫。要抓住它,要么靠人眼,要么靠一个“已经知道这个技能好的样子长什么样”的一致性模型,而后者本身又得用好的示范训练出来。这个问题是递归的,它奖励“第一次就把采集做对”。

在采集现场就判断一段示范的好坏

拦下一段坏示范,成本最低的地方是它被录下的那一刻,而不是几个月后的清洗环节。一份简短的现场清单就能完成大部分工作:这次是第一次尝试就成功了吗?操作者的动作流与观测流是否严格对齐,所见与所令之间有没有延迟?这次的策略与本批其余示范是否一致?它带来了新的覆盖,还是只是上一条的近似副本?所有模态是否都完整并同步?任何一项答“否”,这段示范就要在进入训练之前先修好或直接丢弃。事后再清洗当然可行,但它慢、有损,而且在赶工期时很容易被跳过。

跨操作者的一致性,是团队最容易低估的一个维度。让十个人去“倒一杯水”,会得到十种握瓶角度、不同的接近方向、不同的停止水位。一部分变化是健康的覆盖;但变化太多,策略看到的就是一个没有稳定结构的任务,学出来的是一团谁也不满意的“平均糊”。解法不是用一本扼杀变化的规则手册,而是给出一个关于“这个技能的内核到底是什么”的共同参照,让变化围绕一个中心落地,而不是四处飞散。

数据规模决定你的策略能走多远,数据质量决定它是否值得出发。行为克隆无法超越它被喂给的示范。

先看质量,再谈规模

通往可靠机器人的路,不会靠把更多平庸示范堆进训练集走完。会走完这条路的,是那些能分辨好坏、能在采集现场就把坏示范挡在门外的团队。规模依然重要,但它是乘数,而不是替代品。先把单段示范做对,再去乘以数量,你得到的是复利;顺序反过来,你放大的只是噪声。

demonstrationdata-qualityimitation-learningdatasets

来源