Gemini Robotics On-Device 2是一种运行在机器人本地的视觉—语言—动作模型(VLA)。它把文字指令、相机图像和机器人本体状态转换为数值动作,减少云端往返对操作延迟与连通性的影响。
本地运行不等于任何人都能下载。截至2026年8月6日,On-Device 2只面向Trusted Testers,不在公开Gemini API模型列表中。可结合机器人边缘AI指南判断它解决的是哪一类部署问题。
On-Device 2的本质是本地动作模型
Google DeepMind的On-Device 2模型卡说明,该模型基于on-device Gemma与Gemini Robotics 1.5技术。输入包含文字、图像和数值本体状态,输出是数值机器人动作。
它与ER 2的区别不在名称,而在输出。ER 2是高层VLM,返回文字和函数调用;On-Device 2是VLA,直接生成动作表示。VLA与VLM对比可从接口层看清这条边界。
数值动作仍需由控制器执行并受安全系统限制。关节限位、速度和力约束、碰撞检测、急停与状态估计不会因为使用本地VLA而消失。
| 比较项 | On-Device 2 | ER 2 |
|---|---|---|
| 模型类型 | VLA | VLM |
| 运行位置 | 机器人本地 | Gemini API |
| 主要输入 | 指令、图像、本体状态 | 文字、图像、视频、音频 |
| 主要输出 | 数值机器人动作 | 文字、函数调用 |
| 开放状态 | Trusted Testers | 公开预览 |
本地推理减少云端往返,也引入硬件约束
云端方案要上传观察、等待推理再返回结果,网络抖动或断连会影响操作。本地VLA把主要动作推理放到机载计算平台,更适合网络条件有限、连续操作较多的环境。
代价是算力、显存、功耗、散热和模型大小都受到机体限制。本地不必然等于低延迟,摄像头采集、预处理、推理、动作下发和控制队列仍要逐段测量。
“在本地推理”也不必然表示整套系统永久离线。模型分发、版本更新、日志回传和远程监控是否联网,应按实际提供方案分别核对。
| 维度 | 本地推理的作用 | 仍需检查 |
|---|---|---|
| 网络 | 降低云端往返依赖 | 更新和监控是否联网 |
| 延迟 | 省去网络传输 | 设备上的最坏推理时间 |
| 数据 | 减少原始视频外发 | 日志、训练数据的去向 |
| 资源 | 现场持续执行 | 功耗、热、内存和算力上限 |
少于200个示例是Google结果,不是固定门槛
Google DeepMind介绍页称,团队用少于200个示例和数小时训练把模型适配到新机器人。这个结果说明少样本适配具有潜力,也可能降低采集新机体数据的成本。
它不表示任意机器人和任务都只需199个示例。自由度、相机位置、夹爪、控制频率、物体变化与示教质量都会改变数据需求,Google公开的条件不能直接外推到所有现场。
评测时应覆盖成功以外的情况:物体偏移、照明变化、打滑、抓取失败、恢复动作和未见对象。示例数量只有和任务分布、测试集隔离及失败记录放在一起才有意义。

模型卡把重点放在双臂操作
模型卡的主要预期用途是双臂机器人操作,通过语言和视觉生成与物体交互的动作。文档没有把它描述为覆盖所有移动机器人、腿式平台或全身控制的通用策略。
已知限制包括分布外任务,以及向高自由度机器人泛化。机体结构、传感器和控制接口变化后,可能需要额外示教、微调和动作映射。
Google给出了仿真和实机评测,也采用了分层安全方法,但这不是安全认证,更不能证明模型在人员密集环境中可以无监督运行。
| 项目 | 官方资料支持的结论 | 不能推出的结论 |
|---|---|---|
| 主要任务 | 以双臂操作为重点 | 覆盖所有机器人形态 |
| 适配数据 | Google报告少于200个示例 | 每个任务都有固定上限 |
| 安全 | 采用分层测试与限制 | 已经获得现场安全认证 |
| 开放范围 | Trusted Testers | 公开API或模型权重下载 |
当前只能申请Trusted Testers
On-Device 2官方页面提供Trusted Testers申请入口,但没有可供普通开发者直接调用的公开模型ID、下载链接或统一价格。是否获得访问由Google筛选并适用单独条件。
Google物理AI布局将ER 2公开预览与On-Device 2受限测试分开。两者属于同一代机器人模型,不代表开放方式相同。
申请团队应先准备目标机体、任务定义、数据采集方案、机载计算资源、安全环境和评测指标。这样才能判断合作测试是在解决动作模型问题,还是掩盖接口与控制问题。

评估本地VLA要按系统顺序进行
先确认瓶颈:如果缺少高层规划,应看ER 2具身推理模型;如果云端延迟或动作生成是问题,On-Device 2的方向才更接近需求。
随后在同一任务上测量端到端延迟、最坏延迟、功耗、温度、成功率和人工介入。对未知物体、连续失败、人员靠近和传感器异常单独建测试组。
最后验证独立安全链。动作范围、关节、速度、力和工作区由控制与安全层限制,监控失效时能够物理停止。本地VLA是控制架构的一部分,不承担全部安全责任。
常见问题
Gemini Robotics On-Device 2能完全离线运行吗?
动作推理设计为在机器人本地运行,适合网络受限场景。但模型分发、更新、日志和远程监控是否离线,要看具体提供方案。
普通开发者能下载On-Device 2吗?
截至2026年8月6日不能。它只面向Trusted Testers,没有作为公开Gemini API模型或公开权重提供。
新机器人只需要不到200个示例就能适配吗?
Google报告了少于200个示例的适配结果,但这不是所有机体的保证。自由度、传感器、动作接口、任务变化和数据质量会改变需求。
已核验的官方资料
- Google DeepMind:Gemini Robotics On-Device 2
- Google DeepMind:On-Device 2模型卡
- Google:Gemini Robotics ER 2发布
- Google DeepMind:Gemini Robotics 2安全报告
最后核对:2026年8月6日