VLM(視覺語言模型)主要理解影像與文字,回答場景中「有什麼、在哪裡、彼此有何關係」;VLA(視覺—語言—動作模型)則進一步把觀測與指令轉成機器人可執行的動作。多了動作輸出,訓練資料、控制介面、回饋與安全責任都會改變。
VLM 可以正確指出杯子在盤子旁;VLA 還要選定杯子、找出抓取姿態、產生運動命令,並在杯子滑動時修正。前半段偏向語意理解,後半段必須面對相機校正、機器幾何、控制延遲與接觸力。
比較兩個模型時,不要只看名稱;先確認輸入、輸出、動作表示、控制頻率,以及失敗後誰接手。
VLM 提供資訊,VLA 會改變設備狀態
VLM 的輸出可以是文字說明、物件標籤、影像區域、空間關係或任務分解。這些資訊能支援機器人的感知與規劃,但本身通常不會直接驅動馬達。正確辨識物件,也沒有回答手臂該從哪裡接近、速度多快或碰撞後怎麼辦。
VLA 的輸出則連到動作流程,可能是目標姿態、路徑點、夾爪開合、關節命令或一段動作序列。因為輸出會推動硬體,小幅座標誤差、時間延遲或指令歧義,都可能變成實際碰撞與停機。

| 輸出形式 | 代表的意思 | 仍由下游處理 |
|---|---|---|
| 文字或標籤 | 物件、關係與任務描述 | 路徑規劃與控制 |
| 6D 末端姿態 | 工具的位置與方向 | 逆運動學、關節控制與安全過濾 |
| 2D 或 3D 空間點 | 影像或世界中的目標位置 | 深度、座標轉換與可達性 |
| 關節動作序列 | 特定機器的命令 | 追蹤、接觸處理與復原 |
動作表示決定模型實際控制到哪一層
若模型輸出末端姿態,下游仍要計算關節路徑;若輸出相對位移,系統要定義座標系與比例;若直接輸出關節命令,模型會更依賴特定機器。相同的 VLA 標籤,可能對應完全不同的硬體耦合程度。
短動作序列能減少重複推論,卻可能讓中途修正變慢;低頻策略可以做任務層決策,接觸與平衡仍需要較高頻控制器。沒有動作空間、單位與更新頻率,就無法公平比較模型。
回饋讓動作輸出成為真正的策略
機器抓取後要再次觀察:物件是否固定、位置是否符合預期、是否出現異常力量。若結果不符,下一步應重抓、重新規劃、降速或停止。只把預測動作開環播放,在固定場景可能看起來順暢,環境稍有變化就容易失敗。
回饋也能揭露不確定性。系統可比較預期狀態與實際量測,在差異過大時交給復原程序或人工確認。能否偵測並妥善處理例外,通常比單一成功軌跡更接近部署價值。

VLA 訓練需要同步的機器人資料
VLM 可從大量影像與文字對學習;VLA 還需要觀測、機器狀態、動作命令與任務結果對在同一條時間軸。只有影片畫面,往往缺少關節狀態、控制時序、校正資料與人工介入,無法完整重建可執行策略。
Google Gemini 機器人開發文件展示空間點與軌跡式輸出的應用脈絡;Google DeepMind 的 RT-2 技術說明討論視覺語言知識如何連到動作;Open X-Embodiment 與 RT-X則呈現跨機器資料的研究方向。
理解能力與實機執行要分開評估
模型可能理解指令,卻因深度估測、可達性、控制或接觸問題而失敗。評估時應分開記錄語意目標是否正確、動作預測是否合理、實機任務是否完成,以及是否需要人工介入。
未見條件也要拆開。新指令、新物件、新背景與新機器本體考驗的能力不同;若只給一個平均分數,無法知道模型究竟在哪一層失效。
| 評估層次 | 可記錄的證據 | 常見失敗原因 |
|---|---|---|
| 語言與視覺理解 | 目標物件或區域是否正確 | 誤解指令或場景 |
| 動作預測 | 姿態、路徑或命令誤差 | 動作表示與資料不一致 |
| 實體執行 | 抓取與任務完成率 | 控制、校正或接觸失敗 |
| 操作與復原 | 介入率、重試與安全停止 | 策略無法處理例外 |
VLA 仍只是機器人系統的一部分
部署還需要狀態估測、運動控制、安全功能、日誌、版本管理與維護。部分元件可以用學習方法實作,部分元件仍適合確定性的工程設計。VLA 並不自動代表整台機器已經全自主。
廣泛的機器人基礎模型可能提供跨任務的 VLA 能力,但是否能用在特定機器,仍要看資料介面與實機驗證。
比較模型時,照著整條鏈路問
先列出視覺與語言輸入、機器狀態、動作表示、控制頻率、訓練資料與支援機器;再看試驗條件、人工介入、復原能力與安全限制。即使供應商使用不同標籤,這些欄位仍能形成可比較的規格。
最後要問錯誤發生後會怎樣。能偵測不確定性並把控制權交給安全程序的系統,可能比基準分數較高、卻沒有復原路徑的模型更適合現場。
- 確認模型輸出究竟是語意、空間點、姿態或關節命令
- 把語意準確度與實機任務成功率分開
- 記錄介入、重試、停止與復原
- 換機器或校正後,重新進行受控測試
常見問題
把 VLM 放進機器人,就會變成 VLA 嗎?
不會。VLM 可以提供感知與推理;只有當系統把觀測與語言連到明確的動作表示,才接近 VLA 的功能。
VLA 一定是端到端模型嗎?
不一定。有些模型直接預測低階動作,有些只產生路徑點或任務步驟,再交由傳統控制器執行。
VLA 能讓機器人完全自主嗎?
不能只靠標籤下結論。自主程度還取決於感知、控制、任務覆蓋、復原、安全機制與人工接管條件。
模型名稱不能替代操作邊界
VLA、VLM 與機器人基礎模型都是寬泛標籤。比較公開聲明前,應確認架構、動作介面、測試方法、硬體組態與未驗證條件。