为 VLA 做 post-training:从通才到专才
微调把一个通用机器人策略变成能真正部署的策略。本文具体拆解 VLA 的 post-training:方法、数据、失效模式,以及诚实的评估。
实验室里成功率 90% 的叠衣策略,可能在有人把毛巾换成更硬的一条、把桌子挪动六英寸、或让午后阳光照进房间的那一刻,就跌回抛硬币的水平。权重没有变,变的是世界。这道横在"能演示的策略"和"能交付的策略"之间的鸿沟,几乎总是在 post-training 阶段被填平,而不是在人人都在谈论的预训练里。
视觉-语言-动作(VLA)模型把相机画面加上一条语言指令,直接映射为机器人动作。一个通用检查点,比如 NVIDIA 的 Isaac GR00T N1 或 Physical Intelligence 的 π0,已经吸收了大量本体、场景与动作。它对"拿起杯子"大致意味着什么、手臂如何朝目标挥去,都带有粗略的先验。但它从未见过你的夹爪、你的相机外参、你的光照,以及你对"完成"的定义。post-training 正是把这种宽泛先验,变成能可靠完成某一项任务的策略的那一步。
这种分工令人不安:预训练决定天花板,post-training 决定你是否够得到它。团队花上数月挑选基座模型,却在被当作事后补充的微调配方上输掉整个部署。下面谈的是这套配方到底包含什么、在哪里失效,以及为什么微调数据的构成比它的绝对体量更重要。
通用先验到底给了你什么
在汇集的、跨本体的数据上做预训练,买来的是单靠任务数据无法获得的泛化。Open X-Embodiment 把这一点摆得很清楚:把约一百万条轨迹汇集到 22 种机器人类型上、共同训练一个模型,胜过同样架构只在任何单一机器人数据上训练的结果。表征会迁移。一条见过上千个厨房的手臂,会把可用的"杯子"和"把手"概念带进它从未进过的厨房。
先验没有买来的,是在你真正在意的那个分布上的胜任度。Toyota Research Institute 关于 Large Behavior Models 的工作把这点讲得更利落:预训练策略不只是起点更高,它还需要更少的演示,就能在新技能上达到目标成功率。预训练把整条数据效率曲线往左下方推。post-training 就是你花掉这份效率的方式。
通用 VLA 交给你的,是一个处处看似可行、却处处不可靠的策略。post-training 是一场谈判:决定你把可靠性花在哪里。
post-training 配方,以及每个旋钮的作用
"微调这个 VLA"至少掩盖了四种不同的操作。选错一种,代价是数周。
| 方法 | 改变什么 | 典型数据 | 主要失效模式 |
|---|---|---|---|
| 全量微调 | 全部权重 | 数百到数千条目标演示 | 灾难性遗忘、对特定装置过拟合 |
| 参数高效(LoRA、适配器) | 少量新增权重 | 数十到数百条演示 | 容量不足以应对大的域偏移 |
| 联合训练(co-training) | 全部权重、混合批次 | 目标演示加上一部分预训练混合数据 | 需要预训练数据,还要调混合比例 |
| 强化学习后训练 | 奖励下的策略 | 真机或仿真的 rollout | 奖励设计、采样成本、安全 |
大多数交付系统会把它们组合起来。Physical Intelligence 曾把 π0 描述为一个预训练基座,随后在为目标行为精选的高质量数据上做 post-training;针对原始混合数据的一部分做联合训练,是对抗遗忘的标准手段。Google DeepMind 的 Gemini Robotics 也是同样的呈现方式:一个宽泛模型,被专门化到新任务与新本体上,其中还包括一个更小的端上版本,团队可以用不多的演示去适配。
需要多少数据,以及什么样的数据
体量这个问题有一个无聊的答案,也有一个有意思的答案。无聊的答案是:对固定装置上一个范围清晰的操作任务,几百条干净的遥操作演示,往往就能把预训练 VLA 从不可靠推到可用。有意思的答案是:构成胜过数量。一百条覆盖了尴尬情形的演示,抓取失手、物体落在工作空间边缘、打滑之后的恢复,比一千条几乎雷同的成功教得更多。
来源与一致性,和原始轨迹一样重要。DROID 很有启发:约 76,000 条遥操作轨迹,采集自数百个场景、数十栋建筑,刻意为视觉与空间的多样性、而非单纯规模而构建。微调数据会继承它被采集方式所带的偏差。如果每一条演示都在同一盏灯下、用同样三个物体录制,策略就会悄悄学会那盏灯。微调集里的多样性不是锦上添花,而是能在新房间里存活下来的那部分。
微调在哪里悄悄崩掉
有三种失效模式反复出现。第一是灾难性遗忘:把全部权重狠狠推向一个任务,模型就会丢掉让基座值得使用的语言接地与通用灵巧性。联合训练与参数高效方法,多半就是为对抗这一点而存在。
第二是伪相关。在狭窄集合上微调的策略,会学到在那个集合里预测奖励的一切,包括桌布、时间、或操作员总是从同一姿态起手的习惯。它在评估里看起来出色,一旦这些附带线索之一发生变化,就土崩瓦解。第三是动作空间不匹配:跨多种本体预训练的基座模型,用某一种约定编码动作;如果你机器人的控制接口、频率或夹爪几何与之不合,微调就会把预算耗在重新学接口,而不是学任务上。
评估是团队最被低估的一环
微调后的策略,不能靠训练集损失来信任。真机评估昂贵、缓慢、统计上噪声大,而这恰恰是它被跳过的原因。Toyota Research Institute 在这方面异常公开:他们做盲测、做统计受控的硬件评估,试验次数足以把真实增益和运气区分开,这种纪律值得照搬。一个在 10 次试验里报告 8 次成功的策略,和一个在 100 次里报告 80 次的策略,不是同一个论断。事先就定好:多少次试验、在多大变异下,才算"完成",然后拿这把尺子去要求微调。
通用检查点是容易的那 80%。你真正能部署的专才,活在最后那一段路里:几百条选得好的演示、一种与域偏移规模相称的微调方法、以及一套诚实到能告诉你何时该停下的评估。把这一段当作正戏来对待,因为对任何要交付机器人的人来说,它就是正戏。