机载还是云端推理:策略在哪里运行,数据就得配得上

机器人策略在哪里运行,决定了它能有多快的反应,也决定了你必须采集什么样的数据。

阅读约 6 分钟

人形机器人的手指合拢,握住一枚鸡蛋。抓握必须在蛋壳开始回推的那一刻停下,而这个决定发生在以个位数毫秒计的控制回路里。如果把"停止"信号先发往数据中心再等它返回,鸡蛋早就碎了。

机器人的策略在哪里运行,并不是一个无关紧要的基础设施细节。它为机器人的反应速度设定了一个硬性上限。这个上限决定了哪些任务在物理上可行,也悄悄地规定了你的训练数据必须包含什么。

人们通常把这个问题描述成"机载还是云端",仿佛你必须二选一。更精确的问题要窄得多:策略的哪一部分在哪里运行,以什么频率运行?下面是真正的权衡,以及一个论点:你所选择的分工,应该在机器人出厂之前很久就体现在数据里。

谁都逃不掉的延迟预算

每一个闭环技能都有自己的时钟。富接触任务,比如拧一颗螺栓或插入一个连接器,需要 100 到 1000 Hz 之间的控制回路。在 200 Hz 下,你只有 5 毫秒来完成感知、决策和下达指令。错过这个截止时间,回路就会卡顿,抓握过冲,零件卡死。

云端推理满足不了这个时钟。在网络良好的情况下,往返一次附近的数据中心大约需要 30 到 100 毫秒,这还是在模型开始计算之前。对于每秒只触发几次的规划器来说,这没问题;但对于一个反射动作而言,这是绝望的。像 NVIDIA Isaac GR00T 这样的大型视觉-语言-动作(VLA)模型,其设计目标是理解场景并输出一段动作序列,而不是照看伺服回路,这正是快速回路必须离电机更近的原因。

所以第一条规则很直白:你要求的控制频率越高,推理就必须离电机越近。

机载推理真正的代价

在机器人本体上运行策略,为你换来了速度和独立性,同时也递给你一张账单。花在加速器上的每一瓦电,都是没能用来驱动关节的一瓦,而且它会在密封的躯干里变成热量。一台靠电池供电的人形机器人,扛不动一整机架的 GPU。

这种预算约束逼出了压缩。团队会对权重做量化,把一个大的教师模型蒸馏成一个小的学生模型,并剪掉任务不需要的一切。一个拥有数十亿参数的模型,可能需要缩小一个数量级,才能塞进移动端加速器,同时还要满足帧时间要求。包括 Physical Intelligence 在内、正在推进机载策略的研究团队,投入了大量精力让一个有能力的策略小到足以高速运行。这些压缩没有一样是免费的。你让渡出去的每一分精度,都会在某处变成一次失败的抓取。

云端买来了什么,又如何失灵

云端移除了尺寸上限。你可以部署一个任何机器人都装不下的模型,用一次发布就更新整个机队,并汇集每一台机器的经验。对于一个缓慢的、负责深思熟虑的层,规划一连串步骤、判断任务是否完成,这确实很合适。

还有一个更微妙的好处。当每台机器人的经验都回流到同一个模型时,整个机队会一起进步:一台机器周二遇到的极端情况,可以让所有其它机器周三运行的策略变得更敏锐。这个飞轮是真实的,也是云端连接的技术栈尽管背负延迟税、却依然有吸引力的原因之一。

失效模式同样真实。连通性变成了依赖,一次断线就可能让机器人在动作中途僵住,而这在人身边是不可接受的。延迟不只是高,而且是可变的,抖动比恒定的延迟更难设计应对。把厨房或工厂车间的画面实时传给远程服务器,还会带来隐私和安全问题,而一台自给自足的机器人根本不必回答这些问题。

表 1:机载与云端推理在决定分工的几个维度上的对比
维度机载云端
回路延迟亚毫秒到几毫秒数十到数百毫秒,且可变
模型尺寸上限受功耗与散热约束几乎不受限
连通性需求核心回路无需联网需要持续、低抖动的链路
机队更新逐台推送一次发布,全体生效
最适合的技能反应式、富接触控制低频的规划与感知

大多数认真的团队最终采用的分工

读足够多的部署报告,你会看到一个反复出现的模式。一个快速的反应层以数百 Hz 在机载运行,负责平衡、接触和紧密的感知-动作回路。一个较慢的深思层运行得不那么频繁,跑在更强的机载芯片上或云端,决定接下来做什么。这个框架借用了古老的"系统 1 与系统 2"隐喻,你可以在 Figure 这样的公司描述其技术栈的方式中看到它,也可以在 Toyota Research Institute 关于 Large Behavior Models 的工作中看到它。

这不是一种妥协,而是与物理规律相符。反射和推理在动物身上以不同的速度运行,机器人应当如此,原因是一样的。

策略将在哪里运行,是一个数据决策,而不仅仅是部署决策。你无法训练出一个你从未以反射速度记录过的反射。

为什么这种分工属于你的数据

这是团队往往很晚才发现的部分。机载与云端之间的选择,会一直回溯到数据采集。一个 200 Hz 的反应式控制器,只能用以 200 Hz 或更高频率记录的数据来训练,其中的力和本体感受要采样得足够快,才能看到那些关键的接触事件。把同一次示范以 10 Hz 记录,反射就根本不在文件里,而且事后无法恢复。

由此得出的推论是:一次示范应当同时服务于两个层。高频的力、关节和触觉通道喂给反射层;较低频的视觉和语言喂给规划层。而这只有在每个通道都带着自己准确的时间戳时才行得通,这样下游团队才能把数据重采样到其目标硬件运行的任何频率,无论最后是机载、云端还是两者的混合。

你真正在做的选择

机载还是云端,是个错误的二元对立。几乎每一台有能力的人形机器人,都会在贴近硬件处运行一个快速回路,并在算力最便宜的地方运行一个慢速回路。最终胜出的团队,不会是那些正确猜中部署目标的团队,而是那些数据足够丰富、足够快,从而在硬件成真之后能够支撑任何一种答案的团队。

robot-inferenceonboard-inferencelatencydeploymentcontrol-rate

来源