實體 AI(亦常見稱為物理 AI,Physical AI)是讓人工智慧在真實世界中感知、判斷、行動,再根據結果修正下一步的系統。它不只是「會回答問題的模型」;輸出會推動機器手臂、移動平台、無人機或其他設備,因此任務成功率、反應延遲、失敗復原與安全邊界都要一起看。
最容易理解的場景是拿杯子。相機先找到杯子,系統估算位置與可抓取方向,控制器驅動關節;夾爪閉合後還要確認杯子是否真的被拿起。若物件滑落,機器必須重試、換抓點、請人處理或安全停止。少了最後這段回饋,就只是一次性播放動作。
判斷實體 AI 的關鍵,不是模型名稱,而是它能否在清楚的條件下反覆完成任務,並對偏差做出可預期的處理。
實體 AI 不是把聊天模型裝進機器人
生成式 AI 擅長產生文字、影像、聲音與程式碼;傳統自動化則依照事先設定的流程,在穩定工作站重複動作。實體 AI 面對的是會移動的人、位置不一的物件、改變的光線與載重。它通常會用到生成式模型,但還需要感測、狀態估測、路徑規劃、控制與安全機制。
語言模型可以理解「把紅杯放到托盤」的意圖,卻不會自動知道相機是否校正、夾爪能不能碰到杯緣,或托盤旁是否有人。真正落地的系統要把語意轉成座標、姿態與動作,並把機械限制納入決策。

| 系統類型 | 主要輸入 | 主要輸出 | 失敗時常見後果 |
|---|---|---|---|
| 生成式 AI | 提示與數位資訊 | 文字、影像、程式碼 | 內容錯誤或無法使用 |
| 傳統自動化 | 預設訊號與固定流程 | 重複的機械動作 | 卡料、停機或品質下降 |
| 實體 AI | 持續變動的環境觀測 | 會依回饋調整的實體動作 | 碰撞、損壞、停機或人員風險 |
感知、規劃、控制要形成回饋迴路
感知模組把影像、深度、力覺與關節狀態整理成可供決策的觀測;規劃器決定任務步驟與運動路徑;低階控制器用較高頻率維持位置、速度或力量。這些模組的更新速度不同,介面若沒有對齊,即使各自表現不錯,整體仍可能不穩。
現場最重要的往往不是第一次動作,而是偏差出現後怎麼辦。物件沒有夾牢、通道突然被擋住、定位失去追蹤時,系統要能辨識異常,採取可解釋的復原方式。只剪出成功片段,不能證明回饋迴路能承受真實波動。
身體與環境會替模型劃出能力邊界
每台機器都有工作範圍、額定負載、關節扭矩、速度、電量與溫度上限。模型即使理解任務,也無法執行超出機構能力的姿態或力量。動作生成必須先通過碰撞、可達性與安全限制,不能等指令送出後才發現做不到。
環境同樣會改變結果。反光金屬可能讓深度相機失真,軟袋會改變抓取形狀,狹窄走道會縮小煞停空間。能力說明若沒有交代物件、光線、速度、空間與人員距離,就無法直接套用到另一個現場。

訓練資料與模擬各有角色
遙操作示教能留下任務步驟,實機紀錄包含真實動力學與感測器雜訊,人類影片提供物件互動的線索,模擬則適合大量產生危險、罕見或昂貴的條件。Google DeepMind 的 Gemini Robotics 資料呈現了視覺語言能力延伸到機器人動作的方向,但公開展示仍要回到實機條件判讀。
模擬成功不等於部署完成。Sim-to-Real 模擬轉實機還要處理摩擦、質量、延遲、雜訊與校正誤差,並把真實失敗帶回下一輪訓練。
看展示影片時,先追問測試條件
先確認物件、背景、光線、初始姿態與操作者是否都出現在訓練資料中,再問總共測了多少次、失敗分成哪些類型、人工介入幾次。若只看到最佳片段,讀者無法知道這是穩定能力,還是受控情境下的一次成功。
也要記錄機器本體、感測器、控制頻率與校正方式。即使機器人基礎模型具備跨任務遷移能力,也不代表已經適用另一種夾爪、底盤或產線。
現場指標要能反映失敗成本
任務成功率只是起點。團隊還要追蹤平均完成時間、人工介入率、失敗復原率、非預期停機、能耗,以及故障後恢復生產所需的時間。這些數字才能對應實際產能與維護成本。
例如,成功率由 90% 提升到 95% 看似進步,但剩下的失敗若都要工程師停線排除,整體效益仍可能不佳。概念驗證可把條件寫得更具體:固定工件與工作站,連續 500 次執行,完整記錄成功、失敗、復原和人工處理。
- 先限定物件、工作空間、載重與人員距離
- 成功與失敗使用同一套判定標準
- 越過邊界時減速、降級或安全停止
- 擴大任務前,先重跑固定的回歸測試
安全功能不能只依賴 AI 策略
機械限位、防護裝置、安全感測器、速度與力量限制、保護性停止和緊急停止,仍要依工作站風險配置。當通訊中斷、位置超界、感測器異常或模型信心不足時,獨立安全功能必須能限制能量並停止設備。
實體 AI 的價值最後反映在穩定產出,而不是一張漂亮的模型架構圖。模型版本、硬體組態、測試日期、適用條件與不適用情境都應留下紀錄,讓後續維護與外部讀者知道結論的範圍。
常見問題
實體 AI 和具身智慧是一樣的嗎?
兩者高度重疊,但著眼點不同。具身智慧較強調智慧如何透過身體與環境互動形成;實體 AI 常用來描述能感知、決策並控制真實設備的完整系統。可參考實體 AI 與具身智慧的比較。
只有人形機器人才算實體 AI 嗎?
不是。移動機器人、機器手臂、無人機、自駕車與自適應工業設備,只要會根據真實環境回饋調整動作,都可能屬於實體 AI。
大語言模型可以直接控制馬達嗎?
語言模型適合理解指令與拆解任務;即時運動仍需要狀態估測、動作限制、低階控制與獨立安全機制。把文字輸出直接送到致動器,通常既不穩定也不安全。
把結論留在證據涵蓋的範圍內
本文用於說明技術概念與評估方式,不構成安全認證或採購保證。部署前仍須依設備、工具、工作站與所在地規範進行風險評估。
官方資料:Google AI for Developers 機器人開發說明
延伸閱讀:VLA 與 VLM 的差異