Gemini Robotics ER 2 是什麼:Google 最新物理 AI 有哪些變化

Gemini Robotics ER 2 是 Google DeepMind 於 2026 年 7 月 30 日釋出的機器人視覺語言模型(VLM)。它讀取文字、影像、影片和音訊,根據不斷變化的現場狀態拆分目標、選擇工具,並判斷任務進行到哪一步。

它不是直接輸出關節角、速度或力矩的 VLA,也不是一台 Google 牌機器人。ER 2 位於系統的高層具身推論與任務編排位置,實際動作仍由 VLA、機器人 SDK 和控制器執行。可先對照VLA 與 VLM 的區別物理 AI 的看—想—行動閉環

先說結論:ER 2 是高層編排模型

Google 的ER 2 模型卡將它定義為基於 Gemini 3.5 Flash 的 VLM。輸入可交錯包含文字、影像、影片和音訊,模型輸出文字或函式呼叫,而不是機器人專用的數值動作。

開發者需要把 navigate、inspect、pick 等受控函式提供給模型。ER 2 選擇函式並填寫參數,應用程式驗證權限和現場狀態後,再透過機器人介面執行。速度、工作區、超時和急停不能交給生成模型自行決定。

判斷模型角色最簡單的方法,是看它返回什麼。下表把高層推論、動作策略、控制與安全分開,避免把一次推論成功當成整機自主能力。

系統層典型輸出主要職責
Gemini Robotics ER 2文字、函式呼叫理解、規劃、任務編排、進度跟蹤
VLA 或動作策略數值機器人動作把意圖轉換為動作序列
機器人控制器馬達命令執行高頻、確定性的控制
獨立安全系統限制或停止保護人員、裝置與工作區

與 ER 1.6 相比,變化集中在時間軸上

單張圖片能告訴模型物體在哪裡,卻很難說明夾爪是否已經閉合、物品是否掉落、人員是否剛進入區域。ER 2 強調連續影片理解:把前後觀察連線起來,更新任務狀態,再決定下一步。

ER 1.6 指南同樣涉及具身推論和工具呼叫,但 ER 2 的官方釋出把持續觀察、關鍵時刻定位、長任務進度和多機器人協作放在更核心的位置。舊版本的歷史資訊不應被新文章覆蓋。

Google 的棄用檔案顯示,ER 1.6 定於 2026 年 8 月 31 日停止服務。遷移不能只替換模型 ID,還應重新測試函式參數、結構化輸出、延遲、費用以及舊提示詞是否仍然適用。

比較項ER 1.6ER 2
狀態舊版預覽,已列入停用計劃目前公開預覽
官方重點具身推論與高層規劃連續影片、進度跟蹤、協作
動作輸出不直接輸出馬達動作仍不直接輸出馬達動作
採用方式保留歷史測試結果用同一任務集重新評估

連續影片讓模型知道任務進行到哪裡

ER 2 不只是給每一影格貼標籤,而是嘗試理解動作前後發生了什麼。對於取放、巡檢或多步驟裝配,模型可以根據新的畫面判斷步驟完成、失敗或需要重新規劃。

Google 釋出文章報告,在 Google 設定的評測中,進度分類為 57.4%;關鍵時刻定位為 91.3%,平均絕對時間誤差為 0.96 秒。

這些是 Google 自己的模型評測,不是工廠、倉庫或家庭中的任務成功率。攝影機角度、照明、函式設計、網路延遲與機器人硬體變化後,結果可能完全不同。

Google 評測項報告值正確理解
進度分類57.4%在指定評測中判斷任務階段
關鍵時刻定位91.3%在影片中找到目標事件
平均絕對時間誤差0.96 秒定位時刻與標註的平均偏差
機器人實驗室中的 PR2 移動操作機器人
移動操作機器人同時包含導航、感知和機械臂,但該照片並不展示 ER 2 或其效能。 來源:Oleg Alexandrov / Wikimedia Commons。授權:CC BY-SA 3.0

工具呼叫把語言計劃接到機器人能力上

ER 2 可以把搜尋、程式碼執行和函式呼叫納入計劃。在機器人應用中,更穩妥的做法是隻公開少量含義明確的函式,例如移動到指定區域、讀取儀表、抓取已知物體,而不是開放全部底層命令。

Google 還展示了 Apptronik Apollo 2 與 Franka F3 Duo 分工的研究展示。高層模型把任務分給能力不同的機器人,並根據結果繼續安排步驟。它說明一種編排思路,但沒有證明通用互操作標準已經完成。

如果要理解 Google 把模型、API 與合作機器人放在什麼位置,可閱讀Google 物理 AI 佈局。接入不同機體仍需要適配器、權限規則、失敗恢復和安全驗證。

標準版與流式版都處於公開預覽

截至 2026 年 8 月 6 日,標準模型 ID 為 gemini-robotics-er-2-preview,流式模型 ID 為 gemini-robotics-er-2-streaming-preview。兩者可透過 Gemini API 和 Google AI Studio 測試;Enterprise Agent Platform 則是單獨的私有預覽。

標準版適合在決策點發起請求,支援結構化輸出、函式呼叫、程式碼執行、快取與多種檢索工具。流式版透過 Live API 持續接收觀察,更適合邊看邊跟蹤,但不能替代伺服控制或快速碰撞迴避。

兩種端點的功能與費用不完全相同,詳見ER 2 價格與 API 指南。預覽階段的模型名、配額、工具支援和價格都可能調整。

專案標準預覽流式預覽
模型 IDgemini-robotics-er-2-previewgemini-robotics-er-2-streaming-preview
互動方式請求—反應Live API 雙向流
函式呼叫支援支援
結構化輸出與 Batch支援不支援
適合場景規劃、分析、非同步工作流持續觀察與低延遲對話
以五個步驟整理Gemini Robotics ER 2 是什麼:Google 最新物理 AI 有哪些變化的判讀重點
依正文與一手資料整理的繁體中文實務卡。來源:Physical AI Lab。

公開預覽不等於可直接承擔安全責任

模型卡明確排除故障可能造成人員傷亡或財產損失的安全關鍵用途。生成模型會誤讀畫面、生成錯誤參數或選擇不合適的工具,因此需要獨立急停、速度和力限制、區域監控及人工接管。

機器人影片和音訊若包含可辨識人員,Google 的機器人文件要求事先充分告知並取得同意,還建議用人臉模糊、限制拍攝區域等辦法減少個人資料。免費與付費服務的資料條件也需分別核對。

ER 2 不是成品機器人或安全認證控制器。與On-Device 2 本地 VLA對照後,再決定高層推論、動作生成、控制與安全各自放在哪裡。

常見問題

Gemini Robotics ER 2 是 VLA 嗎?

不是。Google 把 ER 2 定義為用於具身推論的 VLM,它輸出文字或函式呼叫。機器人專用數值動作仍由 VLA、動作策略或控制器產生。

開發者現在能使用 Gemini Robotics ER 2 嗎?

能。截至 2026 年 8 月 6 日,標準版和流式版都可透過 Gemini API 與 Google AI Studio 公開預覽,但預覽功能和價格可能變化。

接入 ER 2 後機器人會自動具備完整自主能力嗎?

不會。開發者仍需提供機器人介面、動作策略、函式驗證、低層控制、失敗恢復與獨立安全系統。官方展示不代表所有機器人可直接相容。

已核驗的官方資料

最後核對:2026 年 8 月 6 日