如果實驗關注未來互動預測、合成軌跡或世界模型增強策略,應先看UnifoLM-WMA-0。如果核心任務是從視覺和語言直接學習操作動作,則UnifoLM-VLA-0更合適。
兩套倉庫都公開了程式碼和模型,但不等於能不做修改地裝到所有 G1 或 Z1 上。選擇前先比較官方示例與自己的機器人設定,包括攝影機、末端效應器、狀態與動作維度。
WMA 與 VLA 解決的核心問題不同
UnifoLM-WMA-0 為世界模型定義了兩種用途:作為互動模擬引擎生成未來互動影片,以及與動作頭連線,在預測未來的同時改進決策。訓練時可以按需要選擇模式。
UnifoLM-VLA-0 繼續用機器人操作資料訓練視覺語言骨幹,直接預測動作。選擇標準不是哪個名稱更新,而是未來影片還是直接動作更接近研究假設。
| 決策項 | UnifoLM-WMA-0 | UnifoLM-VLA-0 |
|---|---|---|
| 主要角色 | 世界預測與動作結合 | 視覺語言到動作 |
| 公開模式 | 互動模擬與決策 | 模擬評測與實體推論 |
| 示例資料 | Z1、雙臂 Z1 和 G1 | 12 類 G1 操作資料 |
| 適合研究 | 未來軌跡和策略增強 | 直接操作策略 |
兩個倉庫的資料集不能直接互換
WMA 倉庫列出五套主要開放資料,覆蓋 Z1、雙臂 Z1 和 G1,另有 G1 靈巧臂資料。官方 Dual 檢查點在五套宇樹資料上同時微調了決策和模擬模式。
VLA 倉庫則列出堆疊、裝袋、擦拭、疊毛巾等十二類 G1 任務。資料名都寫 G1,也不能證明夾爪、攝影機校正和動作表示與自己的硬體完全一致。
訓練流程在接入實機之前就已經分叉
WMA 先把影片生成模型適配成世界模型,再用下游任務資料訓練決策和模擬模式。即使只保留一種模式,也要正確設定狀態、動作與相機輸入。
VLA 把 LeRobot 資料轉換為 HDF5 和 RLDS,註冊資料集與混合比例,再設定動作塊、狀態維度和正規化。原始影片不會自動變成安全可部署的策略。
| 部署前檢查 | 為什麼重要 | 忽略後的風險 |
|---|---|---|
| CUDA 與依賴版本 | 兩個倉庫環境不同 | 構建或核心不相容 |
| 相機視角與校正 | WMA 註明主視角限制 | 空間預測錯誤 |
| 動作和狀態維度 | 必須匹配機器人形態 | 無效或危險指令 |
| 正規化和檢查點 | 連線訓練與推論尺度 | 動作幅度失真 |

兩種實體示例都採用伺服器—機器人分工
WMA 決策示例在伺服器執行推論,宇樹客戶端採集觀察並請求動作。G1 Dex1 示例命令還指定了動作與觀察時域、控制頻率和語言指令。
VLA 同樣記錄了伺服器推論與機器人客戶端。網路傳輸、模型和底層控制是不同責任層,可用物理 AI 觀察—思考—行動框架劃清故障邊界。
先選研究問題,再決定用哪套框架
要驗證想像的未來能否改善動作選擇,或合成軌跡是否有用,選 WMA。要驗證語言指令和視覺觀察能否直接生成操作動作,選 VLA。
只有機器人、任務、資料預算和成功標準一致,效能比較才有意義。直接策略可參考VLA 評測指南,未來預測則應結合世界模型解讀設定獨立指標。

開放原始碼仍需逐台驗證硬體與安全邊界
接入 G1 或 Z1 前,確認倉庫提交、模型卡、機器人客戶端、控制模式、急停和關節限制。必須先透過離線回放與模擬,再允許即時動作。
兩個倉庫都沒有保證無修改支援所有宇樹選件,也沒有提供認證安全層。每次結果都應記錄硬體、韌體和提交版本,避免把實驗展示寫成受支援的商業設定。
團隊最好為每次復現儲存作業系統、CUDA 與驅動版本、依賴鎖檔案、模型權重雜湊和機器人設定。若同一任務在模擬與實機上的結果不同,應先檢查觀測頻率、動作縮放、座標系和時延,而不是直接歸因於模型優劣。比較實驗還要固定訓練步數、資料量、隨機種子與安全限制,並同時報告成功率、延遲、碰撞和人工接管次數。模型輸出之外的低層控制器、濾波器和安全停止邏輯也應記錄,否則無法公平解釋實機差異。
常見問題
UnifoLM-WMA 只是一個模擬器嗎?
不是。它既提供互動世界模型,也提供把世界預測連線到動作頭的決策模式和實體機器人示例。
UnifoLM-VLA 支援所有 G1 設定嗎?
倉庫包含 G1 資料和實體流程,但攝影機、夾爪、動作維度、正規化、控制器和檢查點都要匹配實際設定。
第一次實驗應該選哪個?
研究未來影片和世界模型動作路線選 WMA,研究視覺語言直接操作選 VLA,並從最接近自己機器人形態的官方示例開始。
已核驗的官方資料
最後查核:2026 年 8 月 7 日