Gemini Robotics ER 2是Google DeepMind于2026年7月30日发布的机器人视觉语言模型(VLM)。它读取文字、图像、视频和音频,根据不断变化的现场状态拆分目标、选择工具,并判断任务进行到哪一步。
它不是直接输出关节角、速度或力矩的VLA,也不是一台Google牌机器人。ER 2位于系统的高层具身推理与任务编排位置,实际动作仍由VLA、机器人SDK和控制器执行。可先对照VLA与VLM的区别和物理AI的看—想—行动闭环。
先说结论:ER 2是高层编排模型
Google的ER 2模型卡将它定义为基于Gemini 3.5 Flash的VLM。输入可交错包含文字、图像、视频和音频,模型输出文字或函数调用,而不是机器人专用的数值动作。
开发者需要把navigate、inspect、pick等受控函数提供给模型。ER 2选择函数并填写参数,应用程序验证权限和现场状态后,再通过机器人接口执行。速度、工作区、超时和急停不能交给生成模型自行决定。
判断模型角色最简单的方法,是看它返回什么。下表把高层推理、动作策略、控制与安全分开,避免把一次推理成功当成整机自主能力。
| 系统层 | 典型输出 | 主要职责 |
|---|---|---|
| Gemini Robotics ER 2 | 文字、函数调用 | 理解、规划、任务编排、进度跟踪 |
| VLA或动作策略 | 数值机器人动作 | 把意图转换为动作序列 |
| 机器人控制器 | 电机命令 | 执行高频、确定性的控制 |
| 独立安全系统 | 限制或停止 | 保护人员、设备与工作区 |
与ER 1.6相比,变化集中在时间轴上
单张图片能告诉模型物体在哪里,却很难说明夹爪是否已经闭合、物品是否掉落、人员是否刚进入区域。ER 2强调连续视频理解:把前后观察连接起来,更新任务状态,再决定下一步。
ER 1.6指南同样涉及具身推理和工具调用,但ER 2的官方发布把持续观察、关键时刻定位、长任务进度和多机器人协作放在更核心的位置。旧版本的历史信息不应被新文章覆盖。
Google的弃用文档显示,ER 1.6定于2026年8月31日停止服务。迁移不能只替换模型ID,还应重新测试函数参数、结构化输出、延迟、费用以及旧提示词是否仍然适用。
| 比较项 | ER 1.6 | ER 2 |
|---|---|---|
| 状态 | 旧版预览,已列入停用计划 | 当前公开预览 |
| 官方重点 | 具身推理与高层规划 | 连续视频、进度跟踪、协作 |
| 动作输出 | 不直接输出电机动作 | 仍不直接输出电机动作 |
| 采用方式 | 保留历史测试结果 | 用同一任务集重新评估 |
连续视频让模型知道任务进行到哪里
ER 2不只是给每一帧贴标签,而是尝试理解动作前后发生了什么。对于取放、巡检或多步骤装配,模型可以根据新的画面判断步骤完成、失败或需要重新规划。
Google发布文章报告,在Google设定的评测中,进度分类为57.4%;关键时刻定位为91.3%,平均绝对时间误差为0.96秒。
这些是Google自己的模型评测,不是工厂、仓库或家庭中的任务成功率。摄像头角度、照明、函数设计、网络延迟与机器人硬件变化后,结果可能完全不同。
| Google评测项 | 报告值 | 正确理解 |
|---|---|---|
| 进度分类 | 57.4% | 在指定评测中判断任务阶段 |
| 关键时刻定位 | 91.3% | 在视频中找到目标事件 |
| 平均绝对时间误差 | 0.96秒 | 定位时刻与标注的平均偏差 |

工具调用把语言计划接到机器人能力上
ER 2可以把搜索、代码执行和函数调用纳入计划。在机器人应用中,更稳妥的做法是只公开少量含义明确的函数,例如移动到指定区域、读取仪表、抓取已知物体,而不是开放全部底层命令。
Google还展示了Apptronik Apollo 2与Franka F3 Duo分工的研究演示。高层模型把任务分给能力不同的机器人,并根据结果继续安排步骤。它说明一种编排思路,但没有证明通用互操作标准已经完成。
如果要理解Google把模型、API与合作机器人放在什么位置,可阅读Google物理AI布局。接入不同机体仍需要适配器、权限规则、失败恢复和安全验证。
标准版与流式版都处于公开预览
截至2026年8月6日,标准模型ID为gemini-robotics-er-2-preview,流式模型ID为gemini-robotics-er-2-streaming-preview。两者可通过Gemini API和Google AI Studio测试;Enterprise Agent Platform则是单独的私有预览。
标准版适合在决策点发起请求,支持结构化输出、函数调用、代码执行、缓存与多种检索工具。流式版通过Live API持续接收观察,更适合边看边跟踪,但不能替代伺服控制或快速碰撞回避。
两种端点的功能与费用不完全相同,详见ER 2价格与API指南。预览阶段的模型名、配额、工具支持和价格都可能调整。
| 项目 | 标准预览 | 流式预览 |
|---|---|---|
| 模型ID | gemini-robotics-er-2-preview | gemini-robotics-er-2-streaming-preview |
| 交互方式 | 请求—响应 | Live API双向流 |
| 函数调用 | 支持 | 支持 |
| 结构化输出与Batch | 支持 | 不支持 |
| 适合场景 | 规划、分析、异步工作流 | 持续观察与低延迟对话 |

公开预览不等于可直接承担安全责任
模型卡明确排除故障可能造成人员伤亡或财产损失的安全关键用途。生成模型会误读画面、生成错误参数或选择不合适的工具,因此需要独立急停、速度和力限制、区域监控及人工接管。
机器人视频和音频若包含可识别人员,Google的机器人文档要求事先充分告知并取得同意,还建议用人脸模糊、限制拍摄区域等办法减少个人数据。免费与付费服务的数据条件也需分别核对。
ER 2不是成品机器人或安全认证控制器。与On-Device 2本地VLA对照后,再决定高层推理、动作生成、控制与安全各自放在哪里。
常见问题
Gemini Robotics ER 2是VLA吗?
不是。Google把ER 2定义为用于具身推理的VLM,它输出文字或函数调用。机器人专用数值动作仍由VLA、动作策略或控制器产生。
开发者现在能使用Gemini Robotics ER 2吗?
能。截至2026年8月6日,标准版和流式版都可通过Gemini API与Google AI Studio公开预览,但预览功能和价格可能变化。
接入ER 2后机器人会自动具备完整自主能力吗?
不会。开发者仍需提供机器人接口、动作策略、函数验证、低层控制、失败恢复与独立安全系统。官方演示不代表所有机器人可直接兼容。
已核验的官方资料
- Google:Gemini Robotics ER 2发布
- Google DeepMind:Gemini Robotics ER 2模型卡
- Google AI for Developers:ER 2模型信息
- Google AI for Developers:弃用与停用计划
- Google DeepMind:Gemini Robotics 2安全报告
最后核对:2026年8月6日