Gemini Robotics On-Device 2 是什麼:在機器人本地執行的 VLA

Gemini Robotics On-Device 2 是一種執行在機器人本地的視覺—語言—動作模型(VLA)。它把文字指令、相機影像和機器人本體狀態轉換為數值動作,減少雲端往返對操作延遲與連通性的影響。

本地執行不等於任何人都能下載。截至 2026 年 8 月 6 日,On-Device 2 只面向 Trusted Testers,不在公開 Gemini API 模型列表中。可結合機器人邊緣 AI 指南判斷它解決的是哪一類部署問題。

On-Device 2 的本質是本地動作模型

Google DeepMind 的On-Device 2 模型卡說明,該模型基於 on-device Gemma 與 Gemini Robotics 1.5 技術。輸入包含文字、影像和數值本體狀態,輸出是數值機器人動作。

它與 ER 2 的區別不在名稱,而在輸出。ER 2 是高層 VLM,返回文字和函式呼叫;On-Device 2 是 VLA,直接生成動作表示。VLA 與 VLM 比較可從介面層看清這條邊界。

數值動作仍需由控制器執行並受安全系統限制。關節限位、速度和力約束、碰撞檢測、急停與狀態估計不會因為使用本地 VLA 而消失。

比較項On-Device 2ER 2
模型類型VLAVLM
執行位置機器人本地Gemini API
主要輸入指令、影像、本體狀態文字、影像、影片、音訊
主要輸出數值機器人動作文字、函式呼叫
開放狀態Trusted Testers公開預覽

本地推論減少雲端往返,也引入硬體約束

雲端方案要上傳觀察、等待推論再返回結果,網路抖動或斷連會影響操作。本地 VLA 把主要動作推論放到機載計算平台,更適合網路條件有限、連續操作較多的環境。

代價是算力、視訊記憶體、功耗、散熱和模型大小都受到機體限制。本地不必然等於低延遲,攝影機採集、預處理、推論、動作下發和控制佇列仍要逐段測量。

“在本地推論”也不必然表示整套系統永久離線。模型分發、版本更新、紀錄回傳和遠端監控是否連網,應按實際提供方案分別核對。

維度本地推論的作用仍需檢查
網路降低雲端往返依賴更新和監控是否連網
延遲省去網路傳輸裝置上的最壞推論時間
資料減少原始影片外發紀錄、訓練資料的去向
資源現場持續執行功耗、熱、記憶體和算力上限

少於 200 個示例是 Google 結果,不是固定門檻

Google DeepMind 介紹頁稱,團隊用少於 200 個示例和數小時訓練把模型適配到新機器人。這個結果說明少樣本適配具有潛力,也可能降低採集新機體資料的成本。

它不表示任意機器人和任務都只需 199 個示例。自由度、相機位置、夾爪、控制頻率、物體變化與示教質量都會改變資料需求,Google 公開的條件不能直接外推到所有現場。

評測時應覆蓋成功以外的情況:物體偏移、照明變化、打滑、抓取失敗、恢復動作和未見物件。示例數量只有和任務分佈、測試集隔離及失敗記錄放在一起才有意義。

NASA K10 巡視器的野外測試
通訊延遲或中斷時,本地推論可能更有價值。K10 並未搭載 On-Device 2。 來源:NASA via Wikimedia Commons。授權:Public domain, NASA work

模型卡把重點放在雙臂操作

模型卡的主要預期用途是雙臂機器人操作,透過語言和視覺生成與物體互動的動作。檔案沒有把它描述為覆蓋所有移動機器人、腿式平台或全身控制的通用策略。

已知限制包括分佈外任務,以及向高自由度機器人泛化。機體結構、感測器和控制介面變化後,可能需要額外示教、微調和動作對映。

Google 給出了模擬和實機評測,也採用了分層安全方法,但這不是安全認證,更不能證明模型在人員密集環境中可以無監督執行。

專案官方資料支援的結論不能推出的結論
主要任務以雙臂操作為重點覆蓋所有機器人形態
適配資料Google 報告少於 200 個示例每個任務都有固定上限
安全採用分層測試與限制已經獲得現場安全認證
開放範圍Trusted Testers公開 API 或模型權重下載

目前只能申請 Trusted Testers

On-Device 2 官方頁面提供 Trusted Testers 申請入口,但沒有可供普通開發者直接呼叫的公開模型 ID、下載連結或統一價格。是否獲得存取由 Google 篩選並適用單獨條件。

Google 物理 AI 佈局將 ER 2 公開預覽與 On-Device 2 受限測試分開。兩者屬於同一代機器人模型,不代表開放方式相同。

申請團隊應先準備目標機體、任務定義、資料採集方案、機載計算資源、安全環境和評測指標。這樣才能判斷合作測試是在解決動作模型問題,還是掩蓋介面與控制問題。

以五個步驟整理Gemini Robotics On-Device 2 是什麼:在機器人本地執行的 VLA的判讀重點
依正文與一手資料整理的繁體中文實務卡。來源:Physical AI Lab。

評估本地 VLA 要按系統順序進行

先確認瓶頸:如果缺少高層規劃,應看ER 2 具身推論模型;如果雲端延遲或動作生成是問題,On-Device 2 的方向才更接近需求。

隨後在同一任務上測量端對端延遲、最壞延遲、功耗、溫度、成功率和人工介入。對未知物體、連續失敗、人員靠近和感測器異常單獨建測試組。

最後驗證獨立安全鏈。動作範圍、關節、速度、力和工作區由控制與安全層限制,監控失效時能夠物理停止。本地 VLA 是控制架構的一部分,不承擔全部安全責任。

常見問題

Gemini Robotics On-Device 2 能完全離線執行嗎?

動作推論設計為在機器人本地執行,適合網路受限場景。但模型分發、更新、紀錄和遠端監控是否離線,要看具體提供方案。

普通開發者能下載 On-Device 2 嗎?

截至 2026 年 8 月 6 日不能。它只面向 Trusted Testers,沒有作為公開 Gemini API 模型或公開權重提供。

新機器人只需要不到 200 個示例就能適配嗎?

Google 報告了少於 200 個示例的適配結果,但這不是所有機體的保證。自由度、感測器、動作介面、任務變化和資料質量會改變需求。

已核驗的官方資料

最後核對:2026 年 8 月 6 日