1X World ModelはNEOをどう動かす?映像予測からロボット行動まで

1Xの公式World Model研究記事が示すNEOの制御は二段階です。テキストで条件付けたワールドモデルが短い未来映像を予測し、逆動力学モデルがフレーム間をつなぐ行動軌道を求め、NEOが実機で実行します。

生成された画素がそのままモーター指令になるわけではありません。また、この研究だけで全ての家事が自律化されたとも言えません。1Xは深度、幾何、接触、長時間タスクの再計画を課題として明記しています。用語はワールドモデルの基礎で確認できます。

指示は未来映像を経て実行軌道になる

推論時には、NEOのカメラが捉えた開始フレームとテキスト指示が入力されます。ワールドモデルが望ましい未来を映像として展開し、逆動力学モデルが必要な動きを取り出します。

動画を再生してロボットが真似をする仕組みではありません。視覚的な変化をNEOの形状と関節に合う行動へ変換する工程が、画素とアクチュエーターの間にあります。

段階入力出力主なリスク
ワールドモデル開始画像・テキスト未来フレーム自然に見えても物理的に誤る
逆動力学モデル生成フレームの組行動軌道運動学との不一致
NEO実行推定軌道実世界の動作接触・深度・環境差
将来の閉ループ新しい観測と履歴再計画遅延と復旧が未解決

動画の知識を人の視点とNEOの動きで接地する

1X World Modelの技術論文によると、140億パラメータの生成動画モデルを土台に、900時間の一人称人間動画で中間学習し、70時間のロボットデータでNEOの見え方と運動に適応させました。

逆動力学モデルには、ランダムな動きを含む400時間の未選別ロボットデータを使ったと説明しています。これは公開された学習レシピであり、全ての物体や住宅条件を網羅するという意味ではありません。

予測の成功と実機の成功を別々に記録する

生成映像では物をつかめていても、実機では手前で止まったり行き過ぎたりします。1Xも、物体の一貫性、深度、形状、接触を損なう予測と、単眼学習による弱い3D理解を報告しています。

未来予測、抽出した行動、実際のカメラ結果を組で保存すると原因を分けられます。見る・考える・動く流れに当てはめれば、全ての失敗をワールドモデルだけに帰す誤りも防げます。

証拠分かること単独では分からないこと
生成ロールアウト意図する視覚結果現実の接触成功
予測と実行の比較動画選定試行の定性的整合全体の成功率
各タスク30回試行開示条件での再現性あらゆる家庭での性能
未知タスクでの非ゼロ成功自己改善の手掛かり汎用家庭自律性
DARPA Robotics Challenge会場に立つViGIRヒューマノイド
この写真はDARPA Robotics ChallengeのViGIRロボットであり、1X NEOではありません。1X World Modelの動画予測、生成ロールアウト、NEOの実機動作を示す証拠ではありません。 出典: Sun L. Vega / DARPA via Wikimedia Commons. ライセンス: Public domain, U.S. Government work.

現時点の待ち時間は反応作業には長い

1Xによると、複数GPUで5秒分の映像を生成するのに11秒、行動抽出にさらに1秒かかります。ゆっくりした操作には使えても、素早い接触変化への対応には大きな遅延です。

同社は5秒を超える作業に高速推論、履歴メモリー、閉ループ再計画が必要だとしています。短い成功動画を、連続した家事や即時復旧の能力へ広げて解釈してはいけません。

候補を誰が選んだかも評価記録に含める

失敗後に指示を変えたか、複数の未来を生成したか、実行候補を人が選んだかを確認します。1X World Modelの評価記事では1本から8本までの並列生成を試し、選択は手動または自動にできると説明しています。

自律実行と、事前配置、リセット、安全介入も分けます。ロボットデモの遠隔操作を見分ける方法を併用できますが、1XWMの資料だけで画面外の補助が全くないとは断定できません。

1X World ModelはNEOをどう動かす?映像予測からロボット行動までの重要な確認点4項目をまとめたモバイルカード
記事で引用した公式情報と比較表を基にPhysical AI Labが制作した編集カードです。 出典: Physical AI Lab. ライセンス: Owned original.

万能という言葉ではなく再現できる試験で評価する

代表物体と未学習の部屋・指示を決め、完了率、介入率、遅延、失敗型を反復して記録します。生成動画の品質は途中の診断であり、最終指標は実機の結果です。

公開研究の価値は、人・ウェブ動画の知識をNEOの行動へつなぐ具体的な経路にあります。「どの家でも何でもできる」という将来像を、現在の実証結果として扱うべきではありません。

よくある質問

1XWMは動画をモーターへ直接送りますか?

いいえ。ワールドモデルが未来フレームを生成し、別に学習した逆動力学モデルがフレーム間に必要な行動軌道を推定します。

生成映像が自然なら実機も成功しますか?

必ずしも成功しません。1Xは物体の一貫性、深度、形状、接触に関する誤りを報告しており、反復実機試験が必要です。

NEOが全ての家事を自律で行える証拠ですか?

いいえ。公開された条件での研究結果です。遅延、長時間の再計画、復旧は今後の課題として説明されています。

確認した公式情報

最終確認:2026年8月7日