Gemini Robotics 详解:把具身推理装进 VLA

DeepMind 把 Gemini Robotics 拆成负责推理的大脑与负责动作的身体。具身推理如何让一个 VLA 从记忆者变成规划者。

阅读约 7 分钟

让一台 Gemini Robotics 机械臂把一张杂乱的桌面分类清进正确的箱子里,在它动手之前会发生一件不寻常的事。模型先用平白的语言写下一份计划:香蕉是水果,进厨余;揉皱的小票是纸,进可回收;手机两者都不是,别碰它。然后夹爪才开始动作。那段可读的停顿,一台机器人在触碰任何东西之前先把推理说出来,正是 Google DeepMind 一直朝之努力的最清楚的信号。

令人意外的设计取舍在于:Gemini Robotics 并不是一个模型。DeepMind 交付的是一对:一个发出电机指令的视觉-语言-动作(VLA)模型,以及一个独立的推理模型 Gemini Robotics-ER,其中 ER 代表具身推理(embodied reasoning)。这个拆分本身就是全部论点。一个通用机器人策略的难点不在于产生关节角度,而在于知道杯子在哪、该抓哪条边、推一下那摞东西会怎样、以及先做哪一步。DeepMind 的赌注是:这份对世界的理解值得被单独拆成一个组件,预训练一次,反复复用。

本文梳理这一折叠是如何运作的:具身推理在一个朴素的多模态模型之上到底加了什么,负责推理的那一半与负责动作的那一半如何对话,以及这种设计在哪里划算、又在哪里吃力。它写给已经知道 VLA 是什么、想看架构而非发布视频的人。

两个模型,一台机器人

Gemini Robotics 起初是 Gemini 2.0 的一个动作扩展。底座是一个已经能读图与读文的大型多模态模型;DeepMind 把物理动作加成一种输出模态,于是同一个网络既能描述一个场景,也能提出如何在其中移动。这就是 VLA。它本身重度依赖真实的遥操作示范,主要学习的身体是 ALOHA 2 双臂平台。

Gemini Robotics-ER 是另一半,一个被调校到对世界的图景足够清晰、足以驱动机器人的视觉-语言模型:2D 与 3D 物体检测、用像素坐标指向某个被命名的部件、预测抓取、勾画轨迹,以及在多个相机视角之间匹配同一个物体。这些并非抽象才艺。每一项都对应控制器在动作前必须回答的一个问题。一个普通的对话模型能告诉你马克杯有个把手;ER 能告诉你把手占据哪些像素、夹爪该在哪里合拢。

具身推理买到了什么

DeepMind 之所以没有直接把 Gemini 2.0 对准一个夹爪,是因为语言预训练教会模型谈论世界,而不是以电机所需的精度去定位其中的东西。具身推理就是弥合这道缝隙的那一层。它是空间的(在哪、多远、朝向如何),是物理的(什么是刚性、什么会倾倒、什么挡在什么后面),也是时序的(什么必须先于什么发生)。

因为这一层是一个模型,而不是手工调好的感知栈,它继承了底座模型的通用性。你可以问它从未在任何机器人数据集中见过的物体与摆布,它往往仍能指点、仍能估计、仍能给步骤排序,因为底层的 Gemini 在别处见过这个概念。这正是把推理建在基础模型之上、而非把一个检测器硬拼到策略上的回报:奇怪物体与奇怪指令的长尾靠迁移来消化,而不是靠更多标注。

这一注押的是:具身推理是一种预训练一次、就能在不同机器人之间复用的能力,而不是一台机器、一间厨房地磨出来的技能。

先思考,再动手

1.5 这一代把这层折叠摆到了明面上。Gemini Robotics 1.5 会在确定任何动作之前先产生一串自然语言推理,也就是本文开头那段可见的思考。它的搭档 Gemini Robotics-ER 1.5 被提拔为编排者:它接下一个高层目标,拆成若干步,可以调用网页搜索之类的数字工具来补上知识缺口,再把每个具体子任务交给动作模型去执行。一个模型规划与推理,另一个负责移动。

两个后果值得留意。其一,推理是可读的,这让排错更容易:你可以读那份计划,看错误是出在思考里还是出在手上。其二,在一个身体上学到的技能可以迁到另一个身体。DeepMind 描述了在不同本体之间搬运能力,从 ALOHA 2 双臂装置到双臂 Franka 机械臂再到 Apptronik Apollo 人形机器人,而无需对每一个从零重训。跨本体正是 Open X-Embodiment 为整个领域勾勒的那个问题:把不同机器人的经验汇到一起,好让一个策略不被困在单一机身里。

这个家族,以及它如何对比

到 2025 年下半年,这条产品线已有四位值得一提的成员,把它们放在一起读,能看出从只跑在云上的演示走向可以出货之物的轨迹。

截至 2025 年下半年的 Gemini Robotics 模型家族
模型角色运行位置显著特征
Gemini Robotics视觉-语言-动作策略云端在 Gemini 2.0 上把动作作为一种输出模态
Gemini Robotics-ER具身推理 VLM云端检测、指向、抓取与轨迹预测
Gemini Robotics On-Device紧凑型 VLA机器人本机用大约 50 到 100 次示范即可适配,低延迟
Gemini Robotics 1.5 · ER 1.5动作与推理成对云端先用文字推理再动手、工具调用、跨本体迁移

放到同行之间,这套设计读起来是一次刻意的反差。NVIDIA 的 Isaac GR00T 依靠仿真来大批量制造训练数据。Physical Intelligence 把跨多种机器人类型的真实遥操作汇入单一策略。DeepMind 与两者都正交的独到之处在于:让数据保持真实,却把推理从动作里拆出来,好让那份昂贵难学的世界模型被共享,再让一个更小的动作头针对每种身体去特化。

它在哪里吃力

一套两段式的大脑加身体系统买到了清晰,代价是延迟与协同。一个先用文字推理、有时调用工具、再把任务派给动作模型的规划者,比单一的反射式策略更慢,这恰恰是为什么会有一个本机 VLA 存在:这个回路的一部分必须以电机速率在本地跑,而不必往返云端。底下还有一个分工问题:当计划与反射彼此矛盾时,该在多大程度上相信哪一方。

泛化同样有边界。具身推理在物体之间迁移得很出色,但一个推理模型仍可能对只读到过、从没做过的物理笃定地判断错误,而一份写得清楚却错的计划,错还是错。DeepMind 把发布与安全工作配对推出,包括用来判断模型的决策在物理与语义上是否安全的 ASIMOV 基准,这是一个低调的承认:一个流利到足以规划的模型,也流利到足以规划出它不该做的事。

值得盯住什么

有意思的问题不是 Gemini Robotics 能不能在演示台上折出一只折纸狐狸,而是当任务变长、机器人变便宜时,这套推理与动作的拆分还立不立得住。如果具身推理真是一层可复用的东西,同一个大脑就该只在中间换一个新的动作头,便能同时点亮一台仓库机械臂和一台家用人形机器人。如果不是,这个领域就会悄悄滑回到一台机器人、一个房间配一个模型的老路。盯住迁移的结果,而不是精彩集锦。

gemini-roboticsembodied-reasoningvladeepmindfoundations

来源