Gemini Robotics On-Device 2 是一種執行在機器人本地的視覺—語言—動作模型(VLA)。它把文字指令、相機影像和機器人本體狀態轉換為數值動作,減少雲端往返對操作延遲與連通性的影響。
本地執行不等於任何人都能下載。截至 2026 年 8 月 6 日,On-Device 2 只面向 Trusted Testers,不在公開 Gemini API 模型列表中。可結合機器人邊緣 AI 指南判斷它解決的是哪一類部署問題。
On-Device 2 的本質是本地動作模型
Google DeepMind 的On-Device 2 模型卡說明,該模型基於 on-device Gemma 與 Gemini Robotics 1.5 技術。輸入包含文字、影像和數值本體狀態,輸出是數值機器人動作。
它與 ER 2 的區別不在名稱,而在輸出。ER 2 是高層 VLM,返回文字和函式呼叫;On-Device 2 是 VLA,直接生成動作表示。VLA 與 VLM 比較可從介面層看清這條邊界。
數值動作仍需由控制器執行並受安全系統限制。關節限位、速度和力約束、碰撞檢測、急停與狀態估計不會因為使用本地 VLA 而消失。
| 比較項 | On-Device 2 | ER 2 |
|---|---|---|
| 模型類型 | VLA | VLM |
| 執行位置 | 機器人本地 | Gemini API |
| 主要輸入 | 指令、影像、本體狀態 | 文字、影像、影片、音訊 |
| 主要輸出 | 數值機器人動作 | 文字、函式呼叫 |
| 開放狀態 | Trusted Testers | 公開預覽 |
本地推論減少雲端往返,也引入硬體約束
雲端方案要上傳觀察、等待推論再返回結果,網路抖動或斷連會影響操作。本地 VLA 把主要動作推論放到機載計算平台,更適合網路條件有限、連續操作較多的環境。
代價是算力、視訊記憶體、功耗、散熱和模型大小都受到機體限制。本地不必然等於低延遲,攝影機採集、預處理、推論、動作下發和控制佇列仍要逐段測量。
“在本地推論”也不必然表示整套系統永久離線。模型分發、版本更新、紀錄回傳和遠端監控是否連網,應按實際提供方案分別核對。
| 維度 | 本地推論的作用 | 仍需檢查 |
|---|---|---|
| 網路 | 降低雲端往返依賴 | 更新和監控是否連網 |
| 延遲 | 省去網路傳輸 | 裝置上的最壞推論時間 |
| 資料 | 減少原始影片外發 | 紀錄、訓練資料的去向 |
| 資源 | 現場持續執行 | 功耗、熱、記憶體和算力上限 |
少於 200 個示例是 Google 結果,不是固定門檻
Google DeepMind 介紹頁稱,團隊用少於 200 個示例和數小時訓練把模型適配到新機器人。這個結果說明少樣本適配具有潛力,也可能降低採集新機體資料的成本。
它不表示任意機器人和任務都只需 199 個示例。自由度、相機位置、夾爪、控制頻率、物體變化與示教質量都會改變資料需求,Google 公開的條件不能直接外推到所有現場。
評測時應覆蓋成功以外的情況:物體偏移、照明變化、打滑、抓取失敗、恢復動作和未見物件。示例數量只有和任務分佈、測試集隔離及失敗記錄放在一起才有意義。

模型卡把重點放在雙臂操作
模型卡的主要預期用途是雙臂機器人操作,透過語言和視覺生成與物體互動的動作。檔案沒有把它描述為覆蓋所有移動機器人、腿式平台或全身控制的通用策略。
已知限制包括分佈外任務,以及向高自由度機器人泛化。機體結構、感測器和控制介面變化後,可能需要額外示教、微調和動作對映。
Google 給出了模擬和實機評測,也採用了分層安全方法,但這不是安全認證,更不能證明模型在人員密集環境中可以無監督執行。
| 專案 | 官方資料支援的結論 | 不能推出的結論 |
|---|---|---|
| 主要任務 | 以雙臂操作為重點 | 覆蓋所有機器人形態 |
| 適配資料 | Google 報告少於 200 個示例 | 每個任務都有固定上限 |
| 安全 | 採用分層測試與限制 | 已經獲得現場安全認證 |
| 開放範圍 | Trusted Testers | 公開 API 或模型權重下載 |
目前只能申請 Trusted Testers
On-Device 2 官方頁面提供 Trusted Testers 申請入口,但沒有可供普通開發者直接呼叫的公開模型 ID、下載連結或統一價格。是否獲得存取由 Google 篩選並適用單獨條件。
Google 物理 AI 佈局將 ER 2 公開預覽與 On-Device 2 受限測試分開。兩者屬於同一代機器人模型,不代表開放方式相同。
申請團隊應先準備目標機體、任務定義、資料採集方案、機載計算資源、安全環境和評測指標。這樣才能判斷合作測試是在解決動作模型問題,還是掩蓋介面與控制問題。

評估本地 VLA 要按系統順序進行
先確認瓶頸:如果缺少高層規劃,應看ER 2 具身推論模型;如果雲端延遲或動作生成是問題,On-Device 2 的方向才更接近需求。
隨後在同一任務上測量端對端延遲、最壞延遲、功耗、溫度、成功率和人工介入。對未知物體、連續失敗、人員靠近和感測器異常單獨建測試組。
最後驗證獨立安全鏈。動作範圍、關節、速度、力和工作區由控制與安全層限制,監控失效時能夠物理停止。本地 VLA 是控制架構的一部分,不承擔全部安全責任。
常見問題
Gemini Robotics On-Device 2 能完全離線執行嗎?
動作推論設計為在機器人本地執行,適合網路受限場景。但模型分發、更新、紀錄和遠端監控是否離線,要看具體提供方案。
普通開發者能下載 On-Device 2 嗎?
截至 2026 年 8 月 6 日不能。它只面向 Trusted Testers,沒有作為公開 Gemini API 模型或公開權重提供。
新機器人只需要不到 200 個示例就能適配嗎?
Google 報告了少於 200 個示例的適配結果,但這不是所有機體的保證。自由度、感測器、動作介面、任務變化和資料質量會改變需求。
已核驗的官方資料
- Google DeepMind:Gemini Robotics On-Device 2
- Google DeepMind:On-Device 2 模型卡
- Google:Gemini Robotics ER 2 釋出
- Google DeepMind:Gemini Robotics 2 安全報告
最後核對:2026 年 8 月 6 日