Gemini Robotics On-Device 2是什么:在机器人本地运行的VLA

Gemini Robotics On-Device 2是一种运行在机器人本地的视觉—语言—动作模型(VLA)。它把文字指令、相机图像和机器人本体状态转换为数值动作,减少云端往返对操作延迟与连通性的影响。

本地运行不等于任何人都能下载。截至2026年8月6日,On-Device 2只面向Trusted Testers,不在公开Gemini API模型列表中。可结合机器人边缘AI指南判断它解决的是哪一类部署问题。

On-Device 2的本质是本地动作模型

Google DeepMind的On-Device 2模型卡说明,该模型基于on-device Gemma与Gemini Robotics 1.5技术。输入包含文字、图像和数值本体状态,输出是数值机器人动作。

它与ER 2的区别不在名称,而在输出。ER 2是高层VLM,返回文字和函数调用;On-Device 2是VLA,直接生成动作表示。VLA与VLM对比可从接口层看清这条边界。

数值动作仍需由控制器执行并受安全系统限制。关节限位、速度和力约束、碰撞检测、急停与状态估计不会因为使用本地VLA而消失。

比较项On-Device 2ER 2
模型类型VLAVLM
运行位置机器人本地Gemini API
主要输入指令、图像、本体状态文字、图像、视频、音频
主要输出数值机器人动作文字、函数调用
开放状态Trusted Testers公开预览

本地推理减少云端往返,也引入硬件约束

云端方案要上传观察、等待推理再返回结果,网络抖动或断连会影响操作。本地VLA把主要动作推理放到机载计算平台,更适合网络条件有限、连续操作较多的环境。

代价是算力、显存、功耗、散热和模型大小都受到机体限制。本地不必然等于低延迟,摄像头采集、预处理、推理、动作下发和控制队列仍要逐段测量。

“在本地推理”也不必然表示整套系统永久离线。模型分发、版本更新、日志回传和远程监控是否联网,应按实际提供方案分别核对。

维度本地推理的作用仍需检查
网络降低云端往返依赖更新和监控是否联网
延迟省去网络传输设备上的最坏推理时间
数据减少原始视频外发日志、训练数据的去向
资源现场持续执行功耗、热、内存和算力上限

少于200个示例是Google结果,不是固定门槛

Google DeepMind介绍页称,团队用少于200个示例和数小时训练把模型适配到新机器人。这个结果说明少样本适配具有潜力,也可能降低采集新机体数据的成本。

它不表示任意机器人和任务都只需199个示例。自由度、相机位置、夹爪、控制频率、物体变化与示教质量都会改变数据需求,Google公开的条件不能直接外推到所有现场。

评测时应覆盖成功以外的情况:物体偏移、照明变化、打滑、抓取失败、恢复动作和未见对象。示例数量只有和任务分布、测试集隔离及失败记录放在一起才有意义。

NASA K10巡视器的野外测试
通信延迟或中断时,本地推理可能更有价值。K10并未搭载On-Device 2。 来源: NASA via Wikimedia Commons. 许可: Public domain, NASA work.

模型卡把重点放在双臂操作

模型卡的主要预期用途是双臂机器人操作,通过语言和视觉生成与物体交互的动作。文档没有把它描述为覆盖所有移动机器人、腿式平台或全身控制的通用策略。

已知限制包括分布外任务,以及向高自由度机器人泛化。机体结构、传感器和控制接口变化后,可能需要额外示教、微调和动作映射。

Google给出了仿真和实机评测,也采用了分层安全方法,但这不是安全认证,更不能证明模型在人员密集环境中可以无监督运行。

项目官方资料支持的结论不能推出的结论
主要任务以双臂操作为重点覆盖所有机器人形态
适配数据Google报告少于200个示例每个任务都有固定上限
安全采用分层测试与限制已经获得现场安全认证
开放范围Trusted Testers公开API或模型权重下载

当前只能申请Trusted Testers

On-Device 2官方页面提供Trusted Testers申请入口,但没有可供普通开发者直接调用的公开模型ID、下载链接或统一价格。是否获得访问由Google筛选并适用单独条件。

Google物理AI布局将ER 2公开预览与On-Device 2受限测试分开。两者属于同一代机器人模型,不代表开放方式相同。

申请团队应先准备目标机体、任务定义、数据采集方案、机载计算资源、安全环境和评测指标。这样才能判断合作测试是在解决动作模型问题,还是掩盖接口与控制问题。

汇总“Gemini Robotics On-Device 2是什么:在机器人本地运行的VLA”关键判断的判断卡片
Physical AI Lab根据Google官方资料重新整理的编辑卡片。 来源: Physical AI Lab. 许可: Owned original.

评估本地VLA要按系统顺序进行

先确认瓶颈:如果缺少高层规划,应看ER 2具身推理模型;如果云端延迟或动作生成是问题,On-Device 2的方向才更接近需求。

随后在同一任务上测量端到端延迟、最坏延迟、功耗、温度、成功率和人工介入。对未知物体、连续失败、人员靠近和传感器异常单独建测试组。

最后验证独立安全链。动作范围、关节、速度、力和工作区由控制与安全层限制,监控失效时能够物理停止。本地VLA是控制架构的一部分,不承担全部安全责任。

常见问题

Gemini Robotics On-Device 2能完全离线运行吗?

动作推理设计为在机器人本地运行,适合网络受限场景。但模型分发、更新、日志和远程监控是否离线,要看具体提供方案。

普通开发者能下载On-Device 2吗?

截至2026年8月6日不能。它只面向Trusted Testers,没有作为公开Gemini API模型或公开权重提供。

新机器人只需要不到200个示例就能适配吗?

Google报告了少于200个示例的适配结果,但这不是所有机体的保证。自由度、传感器、动作接口、任务变化和数据质量会改变需求。

已核验的官方资料

最后核对:2026年8月6日