1X 官方 World Model 研究文章說明了控制 NEO 的兩個階段:文字條件世界模型先生成一段短期未來影片,逆動力學模型再計算這些畫面之間需要的動作軌跡,最後由 NEO 在真實世界執行。生成的畫素本身不是馬達指令。
這是一套已經整合到 NEO 上的研究策略,但不能證明所有家務都實現了完全自主。1X 明確列出了深度、幾何、接觸錯誤,以及長任務需要更快推論、閉環重規劃和記憶的問題。基礎概念可先看物理 AI 世界模型。
一條指令要經過未來畫面和動作軌跡
推論開始時,系統接收 NEO 攝影機的起始影格和文字指令。世界模型展開期望的未來畫面,逆動力學模型隨後提取可供機器人執行的動作序列。
它並不是播放一段生成影片讓機器人模仿。視覺變化必須被轉換成符合 NEO 形態、關節範圍和運動學的動作,這個轉換層決定畫素能否落到致動器上。
| 階段 | 輸入 | 輸出 | 主要風險 |
|---|---|---|---|
| 世界模型 | 起始影格和文字 | 未來影片影格 | 看似合理但不符合物理 |
| 逆動力學模型 | 生成影格對 | 動作軌跡 | 運動學或動作不匹配 |
| NEO 執行 | 估計軌跡 | 真實運動 | 接觸、深度和環境差異 |
| 未來閉環 | 新觀察與歷史 | 重新規劃 | 延遲與恢復仍待解決 |
影片知識還要用人類視角和 NEO 資料部署
1X World Model 技術論文說明,其骨幹來自一個 140 億參數的生成影片模型,先用 900 小時第一人稱人類影片做中期訓練,再用 70 小時機器人資料適配 NEO 的外觀和運動。
逆動力學模型使用了 400 小時未過濾的機器人運動,其中包含隨機活動。這些數字描述官方訓練配方,不代表模型已經覆蓋每一種物體、房間和接觸條件。
預測成功與實體執行成功必須分開記錄
生成畫面裡順利抓住物體,實體手臂卻可能抓短、抓過頭或失去接觸。1X 也承認生成結果有時過度樂觀,單目預訓練會造成物體一致性、深度、幾何和接觸錯誤。
評測應同時儲存預測未來、提取動作和真實相機結果。藉助觀察—思考—行動閉環定位故障,可以避免把所有錯誤都歸因於世界模型。
| 證據 | 可以說明什麼 | 單獨不能說明什麼 |
|---|---|---|
| 生成軌跡影片 | 計劃中的視覺結果 | 真實接觸是否成功 |
| 預測與執行對照 | 精選試驗的定性一致 | 整個系統的成功率 |
| 每任務 30 次試驗 | 公開設定中的重複性 | 所有家庭場景的表現 |
| 未知任務非零成功 | 自我改進的起點 | 通用家庭自主能力 |

目前推論速度限制了需要快速反應的任務
1X 報告稱,骨幹在多 GPU 上生成 5 秒即時影片需要 11 秒,逆動力學提取動作還要 1 秒。緩慢操作可能容忍這種節奏,快速變化的接觸任務卻很難等待。
公司把更快推論、記憶上下文和閉環重規劃列為處理五秒以上任務的後續工作。一次成功的短影片不能被擴大成連續家務和快速恢復能力。
還要記錄由誰從多個候選中做出選擇
需要確認指令是否在失敗後修改、是否並行生成多個未來、最終執行候選由人還是模型挑選。1X World Model 評估文章公開了從一次到八次並行生成的研究,並說明選擇可以人工或自動完成。
同時把自主執行與場景佈置、復位、安全乾預分開。機器人展示中的遙操作辨識可以補充記錄方法,但 1XWM 文章本身不能排除所有鏡頭外協助。

用可重複試驗替代萬能機器人敘事
選定代表物體、留出的房間和指令,反覆記錄完成率、介入率、延遲和失敗類型。生成影片品質是中間診斷指標,最終結論必須來自真實執行。
這項工作的價值在於展示了一條把網路影片和人類經驗轉成 NEO 動作的具體路線。它提供的是機制與有限的一般化證據,不是“任何家庭、任何任務都能完成”的現狀證明。
復現實驗還應同步儲存輸入畫面、預測片段、最終動作、急停與人工接管時間戳。只有把預測錯誤、抓取失敗、碰撞前停止和成功完成分別統計,才能判斷改進來自世界模型、動作策略還是現場保護層。報告中還應註明推論硬體、模型版本、指令原文與每輪場景復位方式,便於他人判斷結果能否復現。
常見問題
1XWM 會把影片影格直接傳送到 NEO 馬達嗎?
不會。世界模型生成未來影格,獨立訓練的逆動力學模型再估計這些影格之間所需的動作軌跡。
生成影片自然,實體機器人就會成功嗎?
不一定。1X 報告了物體一致性、深度、幾何和接觸方面的錯誤,因此必須透過重複實機執行驗證。
這能證明 NEO 可以自主完成所有家務嗎?
不能。公開的是特定任務的研究結果,延遲、長任務重規劃和恢復仍被列為後續問題。
已核驗的官方資料
最後查核:2026 年 8 月 7 日