Gemini Robotics ER 2是什么:Google最新物理AI有哪些变化

Gemini Robotics ER 2是Google DeepMind于2026年7月30日发布的机器人视觉语言模型(VLM)。它读取文字、图像、视频和音频,根据不断变化的现场状态拆分目标、选择工具,并判断任务进行到哪一步。

它不是直接输出关节角、速度或力矩的VLA,也不是一台Google牌机器人。ER 2位于系统的高层具身推理与任务编排位置,实际动作仍由VLA、机器人SDK和控制器执行。可先对照VLA与VLM的区别物理AI的看—想—行动闭环

先说结论:ER 2是高层编排模型

Google的ER 2模型卡将它定义为基于Gemini 3.5 Flash的VLM。输入可交错包含文字、图像、视频和音频,模型输出文字或函数调用,而不是机器人专用的数值动作。

开发者需要把navigate、inspect、pick等受控函数提供给模型。ER 2选择函数并填写参数,应用程序验证权限和现场状态后,再通过机器人接口执行。速度、工作区、超时和急停不能交给生成模型自行决定。

判断模型角色最简单的方法,是看它返回什么。下表把高层推理、动作策略、控制与安全分开,避免把一次推理成功当成整机自主能力。

系统层典型输出主要职责
Gemini Robotics ER 2文字、函数调用理解、规划、任务编排、进度跟踪
VLA或动作策略数值机器人动作把意图转换为动作序列
机器人控制器电机命令执行高频、确定性的控制
独立安全系统限制或停止保护人员、设备与工作区

与ER 1.6相比,变化集中在时间轴上

单张图片能告诉模型物体在哪里,却很难说明夹爪是否已经闭合、物品是否掉落、人员是否刚进入区域。ER 2强调连续视频理解:把前后观察连接起来,更新任务状态,再决定下一步。

ER 1.6指南同样涉及具身推理和工具调用,但ER 2的官方发布把持续观察、关键时刻定位、长任务进度和多机器人协作放在更核心的位置。旧版本的历史信息不应被新文章覆盖。

Google的弃用文档显示,ER 1.6定于2026年8月31日停止服务。迁移不能只替换模型ID,还应重新测试函数参数、结构化输出、延迟、费用以及旧提示词是否仍然适用。

比较项ER 1.6ER 2
状态旧版预览,已列入停用计划当前公开预览
官方重点具身推理与高层规划连续视频、进度跟踪、协作
动作输出不直接输出电机动作仍不直接输出电机动作
采用方式保留历史测试结果用同一任务集重新评估

连续视频让模型知道任务进行到哪里

ER 2不只是给每一帧贴标签,而是尝试理解动作前后发生了什么。对于取放、巡检或多步骤装配,模型可以根据新的画面判断步骤完成、失败或需要重新规划。

Google发布文章报告,在Google设定的评测中,进度分类为57.4%;关键时刻定位为91.3%,平均绝对时间误差为0.96秒。

这些是Google自己的模型评测,不是工厂、仓库或家庭中的任务成功率。摄像头角度、照明、函数设计、网络延迟与机器人硬件变化后,结果可能完全不同。

Google评测项报告值正确理解
进度分类57.4%在指定评测中判断任务阶段
关键时刻定位91.3%在视频中找到目标事件
平均绝对时间误差0.96秒定位时刻与标注的平均偏差
机器人实验室中的PR2移动操作机器人
移动操作机器人同时包含导航、感知和机械臂,但该照片并不展示ER 2或其性能。 来源: Oleg Alexandrov / Wikimedia Commons. 许可: CC BY-SA 3.0.

工具调用把语言计划接到机器人能力上

ER 2可以把搜索、代码执行和函数调用纳入计划。在机器人应用中,更稳妥的做法是只公开少量含义明确的函数,例如移动到指定区域、读取仪表、抓取已知物体,而不是开放全部底层命令。

Google还展示了Apptronik Apollo 2与Franka F3 Duo分工的研究演示。高层模型把任务分给能力不同的机器人,并根据结果继续安排步骤。它说明一种编排思路,但没有证明通用互操作标准已经完成。

如果要理解Google把模型、API与合作机器人放在什么位置,可阅读Google物理AI布局。接入不同机体仍需要适配器、权限规则、失败恢复和安全验证。

标准版与流式版都处于公开预览

截至2026年8月6日,标准模型ID为gemini-robotics-er-2-preview,流式模型ID为gemini-robotics-er-2-streaming-preview。两者可通过Gemini API和Google AI Studio测试;Enterprise Agent Platform则是单独的私有预览。

标准版适合在决策点发起请求,支持结构化输出、函数调用、代码执行、缓存与多种检索工具。流式版通过Live API持续接收观察,更适合边看边跟踪,但不能替代伺服控制或快速碰撞回避。

两种端点的功能与费用不完全相同,详见ER 2价格与API指南。预览阶段的模型名、配额、工具支持和价格都可能调整。

项目标准预览流式预览
模型IDgemini-robotics-er-2-previewgemini-robotics-er-2-streaming-preview
交互方式请求—响应Live API双向流
函数调用支持支持
结构化输出与Batch支持不支持
适合场景规划、分析、异步工作流持续观察与低延迟对话
汇总“Gemini Robotics ER 2是什么:Google最新物理AI有哪些变化”关键判断的判断卡片
Physical AI Lab根据Google官方资料重新整理的编辑卡片。 来源: Physical AI Lab. 许可: Owned original.

公开预览不等于可直接承担安全责任

模型卡明确排除故障可能造成人员伤亡或财产损失的安全关键用途。生成模型会误读画面、生成错误参数或选择不合适的工具,因此需要独立急停、速度和力限制、区域监控及人工接管。

机器人视频和音频若包含可识别人员,Google的机器人文档要求事先充分告知并取得同意,还建议用人脸模糊、限制拍摄区域等办法减少个人数据。免费与付费服务的数据条件也需分别核对。

ER 2不是成品机器人或安全认证控制器。与On-Device 2本地VLA对照后,再决定高层推理、动作生成、控制与安全各自放在哪里。

常见问题

Gemini Robotics ER 2是VLA吗?

不是。Google把ER 2定义为用于具身推理的VLM,它输出文字或函数调用。机器人专用数值动作仍由VLA、动作策略或控制器产生。

开发者现在能使用Gemini Robotics ER 2吗?

能。截至2026年8月6日,标准版和流式版都可通过Gemini API与Google AI Studio公开预览,但预览功能和价格可能变化。

接入ER 2后机器人会自动具备完整自主能力吗?

不会。开发者仍需提供机器人接口、动作策略、函数验证、低层控制、失败恢复与独立安全系统。官方演示不代表所有机器人可直接兼容。

已核验的官方资料

最后核对:2026年8月6日