机载还是云端推理:策略在哪里运行,数据就得配得上
机器人策略在哪里运行,决定了它能有多快的反应,也决定了你必须采集什么样的数据。
人形机器人的手指合拢,握住一枚鸡蛋。抓握必须在蛋壳开始回推的那一刻停下,而这个决定发生在以个位数毫秒计的控制回路里。如果把"停止"信号先发往数据中心再等它返回,鸡蛋早就碎了。
机器人的策略在哪里运行,并不是一个无关紧要的基础设施细节。它为机器人的反应速度设定了一个硬性上限。这个上限决定了哪些任务在物理上可行,也悄悄地规定了你的训练数据必须包含什么。
人们通常把这个问题描述成"机载还是云端",仿佛你必须二选一。更精确的问题要窄得多:策略的哪一部分在哪里运行,以什么频率运行?下面是真正的权衡,以及一个论点:你所选择的分工,应该在机器人出厂之前很久就体现在数据里。
谁都逃不掉的延迟预算
每一个闭环技能都有自己的时钟。富接触任务,比如拧一颗螺栓或插入一个连接器,需要 100 到 1000 Hz 之间的控制回路。在 200 Hz 下,你只有 5 毫秒来完成感知、决策和下达指令。错过这个截止时间,回路就会卡顿,抓握过冲,零件卡死。
云端推理满足不了这个时钟。在网络良好的情况下,往返一次附近的数据中心大约需要 30 到 100 毫秒,这还是在模型开始计算之前。对于每秒只触发几次的规划器来说,这没问题;但对于一个反射动作而言,这是绝望的。像 NVIDIA Isaac GR00T 这样的大型视觉-语言-动作(VLA)模型,其设计目标是理解场景并输出一段动作序列,而不是照看伺服回路,这正是快速回路必须离电机更近的原因。
所以第一条规则很直白:你要求的控制频率越高,推理就必须离电机越近。
机载推理真正的代价
在机器人本体上运行策略,为你换来了速度和独立性,同时也递给你一张账单。花在加速器上的每一瓦电,都是没能用来驱动关节的一瓦,而且它会在密封的躯干里变成热量。一台靠电池供电的人形机器人,扛不动一整机架的 GPU。
这种预算约束逼出了压缩。团队会对权重做量化,把一个大的教师模型蒸馏成一个小的学生模型,并剪掉任务不需要的一切。一个拥有数十亿参数的模型,可能需要缩小一个数量级,才能塞进移动端加速器,同时还要满足帧时间要求。包括 Physical Intelligence 在内、正在推进机载策略的研究团队,投入了大量精力让一个有能力的策略小到足以高速运行。这些压缩没有一样是免费的。你让渡出去的每一分精度,都会在某处变成一次失败的抓取。
云端买来了什么,又如何失灵
云端移除了尺寸上限。你可以部署一个任何机器人都装不下的模型,用一次发布就更新整个机队,并汇集每一台机器的经验。对于一个缓慢的、负责深思熟虑的层,规划一连串步骤、判断任务是否完成,这确实很合适。
还有一个更微妙的好处。当每台机器人的经验都回流到同一个模型时,整个机队会一起进步:一台机器周二遇到的极端情况,可以让所有其它机器周三运行的策略变得更敏锐。这个飞轮是真实的,也是云端连接的技术栈尽管背负延迟税、却依然有吸引力的原因之一。
失效模式同样真实。连通性变成了依赖,一次断线就可能让机器人在动作中途僵住,而这在人身边是不可接受的。延迟不只是高,而且是可变的,抖动比恒定的延迟更难设计应对。把厨房或工厂车间的画面实时传给远程服务器,还会带来隐私和安全问题,而一台自给自足的机器人根本不必回答这些问题。
| 维度 | 机载 | 云端 |
|---|---|---|
| 回路延迟 | 亚毫秒到几毫秒 | 数十到数百毫秒,且可变 |
| 模型尺寸上限 | 受功耗与散热约束 | 几乎不受限 |
| 连通性需求 | 核心回路无需联网 | 需要持续、低抖动的链路 |
| 机队更新 | 逐台推送 | 一次发布,全体生效 |
| 最适合的技能 | 反应式、富接触控制 | 低频的规划与感知 |
大多数认真的团队最终采用的分工
读足够多的部署报告,你会看到一个反复出现的模式。一个快速的反应层以数百 Hz 在机载运行,负责平衡、接触和紧密的感知-动作回路。一个较慢的深思层运行得不那么频繁,跑在更强的机载芯片上或云端,决定接下来做什么。这个框架借用了古老的"系统 1 与系统 2"隐喻,你可以在 Figure 这样的公司描述其技术栈的方式中看到它,也可以在 Toyota Research Institute 关于 Large Behavior Models 的工作中看到它。
这不是一种妥协,而是与物理规律相符。反射和推理在动物身上以不同的速度运行,机器人应当如此,原因是一样的。
策略将在哪里运行,是一个数据决策,而不仅仅是部署决策。你无法训练出一个你从未以反射速度记录过的反射。
为什么这种分工属于你的数据
这是团队往往很晚才发现的部分。机载与云端之间的选择,会一直回溯到数据采集。一个 200 Hz 的反应式控制器,只能用以 200 Hz 或更高频率记录的数据来训练,其中的力和本体感受要采样得足够快,才能看到那些关键的接触事件。把同一次示范以 10 Hz 记录,反射就根本不在文件里,而且事后无法恢复。
由此得出的推论是:一次示范应当同时服务于两个层。高频的力、关节和触觉通道喂给反射层;较低频的视觉和语言喂给规划层。而这只有在每个通道都带着自己准确的时间戳时才行得通,这样下游团队才能把数据重采样到其目标硬件运行的任何频率,无论最后是机载、云端还是两者的混合。
你真正在做的选择
机载还是云端,是个错误的二元对立。几乎每一台有能力的人形机器人,都会在贴近硬件处运行一个快速回路,并在算力最便宜的地方运行一个慢速回路。最终胜出的团队,不会是那些正确猜中部署目标的团队,而是那些数据足够丰富、足够快,从而在硬件成真之后能够支撑任何一种答案的团队。