Gemini Robotics ER 2 是 Google DeepMind 於 2026 年 7 月 30 日釋出的機器人視覺語言模型(VLM)。它讀取文字、影像、影片和音訊,根據不斷變化的現場狀態拆分目標、選擇工具,並判斷任務進行到哪一步。
它不是直接輸出關節角、速度或力矩的 VLA,也不是一台 Google 牌機器人。ER 2 位於系統的高層具身推論與任務編排位置,實際動作仍由 VLA、機器人 SDK 和控制器執行。可先對照VLA 與 VLM 的區別和物理 AI 的看—想—行動閉環。
先說結論:ER 2 是高層編排模型
Google 的ER 2 模型卡將它定義為基於 Gemini 3.5 Flash 的 VLM。輸入可交錯包含文字、影像、影片和音訊,模型輸出文字或函式呼叫,而不是機器人專用的數值動作。
開發者需要把 navigate、inspect、pick 等受控函式提供給模型。ER 2 選擇函式並填寫參數,應用程式驗證權限和現場狀態後,再透過機器人介面執行。速度、工作區、超時和急停不能交給生成模型自行決定。
判斷模型角色最簡單的方法,是看它返回什麼。下表把高層推論、動作策略、控制與安全分開,避免把一次推論成功當成整機自主能力。
| 系統層 | 典型輸出 | 主要職責 |
|---|---|---|
| Gemini Robotics ER 2 | 文字、函式呼叫 | 理解、規劃、任務編排、進度跟蹤 |
| VLA 或動作策略 | 數值機器人動作 | 把意圖轉換為動作序列 |
| 機器人控制器 | 馬達命令 | 執行高頻、確定性的控制 |
| 獨立安全系統 | 限制或停止 | 保護人員、裝置與工作區 |
與 ER 1.6 相比,變化集中在時間軸上
單張圖片能告訴模型物體在哪裡,卻很難說明夾爪是否已經閉合、物品是否掉落、人員是否剛進入區域。ER 2 強調連續影片理解:把前後觀察連線起來,更新任務狀態,再決定下一步。
ER 1.6 指南同樣涉及具身推論和工具呼叫,但 ER 2 的官方釋出把持續觀察、關鍵時刻定位、長任務進度和多機器人協作放在更核心的位置。舊版本的歷史資訊不應被新文章覆蓋。
Google 的棄用檔案顯示,ER 1.6 定於 2026 年 8 月 31 日停止服務。遷移不能只替換模型 ID,還應重新測試函式參數、結構化輸出、延遲、費用以及舊提示詞是否仍然適用。
| 比較項 | ER 1.6 | ER 2 |
|---|---|---|
| 狀態 | 舊版預覽,已列入停用計劃 | 目前公開預覽 |
| 官方重點 | 具身推論與高層規劃 | 連續影片、進度跟蹤、協作 |
| 動作輸出 | 不直接輸出馬達動作 | 仍不直接輸出馬達動作 |
| 採用方式 | 保留歷史測試結果 | 用同一任務集重新評估 |
連續影片讓模型知道任務進行到哪裡
ER 2 不只是給每一影格貼標籤,而是嘗試理解動作前後發生了什麼。對於取放、巡檢或多步驟裝配,模型可以根據新的畫面判斷步驟完成、失敗或需要重新規劃。
Google 釋出文章報告,在 Google 設定的評測中,進度分類為 57.4%;關鍵時刻定位為 91.3%,平均絕對時間誤差為 0.96 秒。
這些是 Google 自己的模型評測,不是工廠、倉庫或家庭中的任務成功率。攝影機角度、照明、函式設計、網路延遲與機器人硬體變化後,結果可能完全不同。
| Google 評測項 | 報告值 | 正確理解 |
|---|---|---|
| 進度分類 | 57.4% | 在指定評測中判斷任務階段 |
| 關鍵時刻定位 | 91.3% | 在影片中找到目標事件 |
| 平均絕對時間誤差 | 0.96 秒 | 定位時刻與標註的平均偏差 |

工具呼叫把語言計劃接到機器人能力上
ER 2 可以把搜尋、程式碼執行和函式呼叫納入計劃。在機器人應用中,更穩妥的做法是隻公開少量含義明確的函式,例如移動到指定區域、讀取儀表、抓取已知物體,而不是開放全部底層命令。
Google 還展示了 Apptronik Apollo 2 與 Franka F3 Duo 分工的研究展示。高層模型把任務分給能力不同的機器人,並根據結果繼續安排步驟。它說明一種編排思路,但沒有證明通用互操作標準已經完成。
如果要理解 Google 把模型、API 與合作機器人放在什麼位置,可閱讀Google 物理 AI 佈局。接入不同機體仍需要適配器、權限規則、失敗恢復和安全驗證。
標準版與流式版都處於公開預覽
截至 2026 年 8 月 6 日,標準模型 ID 為 gemini-robotics-er-2-preview,流式模型 ID 為 gemini-robotics-er-2-streaming-preview。兩者可透過 Gemini API 和 Google AI Studio 測試;Enterprise Agent Platform 則是單獨的私有預覽。
標準版適合在決策點發起請求,支援結構化輸出、函式呼叫、程式碼執行、快取與多種檢索工具。流式版透過 Live API 持續接收觀察,更適合邊看邊跟蹤,但不能替代伺服控制或快速碰撞迴避。
兩種端點的功能與費用不完全相同,詳見ER 2 價格與 API 指南。預覽階段的模型名、配額、工具支援和價格都可能調整。
| 專案 | 標準預覽 | 流式預覽 |
|---|---|---|
| 模型 ID | gemini-robotics-er-2-preview | gemini-robotics-er-2-streaming-preview |
| 互動方式 | 請求—反應 | Live API 雙向流 |
| 函式呼叫 | 支援 | 支援 |
| 結構化輸出與 Batch | 支援 | 不支援 |
| 適合場景 | 規劃、分析、非同步工作流 | 持續觀察與低延遲對話 |

公開預覽不等於可直接承擔安全責任
模型卡明確排除故障可能造成人員傷亡或財產損失的安全關鍵用途。生成模型會誤讀畫面、生成錯誤參數或選擇不合適的工具,因此需要獨立急停、速度和力限制、區域監控及人工接管。
機器人影片和音訊若包含可辨識人員,Google 的機器人文件要求事先充分告知並取得同意,還建議用人臉模糊、限制拍攝區域等辦法減少個人資料。免費與付費服務的資料條件也需分別核對。
ER 2 不是成品機器人或安全認證控制器。與On-Device 2 本地 VLA對照後,再決定高層推論、動作生成、控制與安全各自放在哪裡。
常見問題
Gemini Robotics ER 2 是 VLA 嗎?
不是。Google 把 ER 2 定義為用於具身推論的 VLM,它輸出文字或函式呼叫。機器人專用數值動作仍由 VLA、動作策略或控制器產生。
開發者現在能使用 Gemini Robotics ER 2 嗎?
能。截至 2026 年 8 月 6 日,標準版和流式版都可透過 Gemini API 與 Google AI Studio 公開預覽,但預覽功能和價格可能變化。
接入 ER 2 後機器人會自動具備完整自主能力嗎?
不會。開發者仍需提供機器人介面、動作策略、函式驗證、低層控制、失敗恢復與獨立安全系統。官方展示不代表所有機器人可直接相容。
已核驗的官方資料
- Google:Gemini Robotics ER 2 釋出
- Google DeepMind:Gemini Robotics ER 2 模型卡
- Google AI for Developers:ER 2 模型資訊
- Google AI for Developers:棄用與停用計劃
- Google DeepMind:Gemini Robotics 2 安全報告
最後核對:2026 年 8 月 6 日