Unitree UnifoLM-WMAとVLAの違い:G1・Z1の学習と実機展開

未来の相互作用を予測したい、合成ロールアウトを作りたい、ワールドモデルで行動方策を補強したい場合はUnifoLM-WMA-0が候補です。視覚と言語から操作行動を直接学習・評価したい場合はUnifoLM-VLA-0が近い出発点です。

どちらもコードと重みを公開した研究リポジトリであり、全てのUnitreeロボットにそのまま入る商用自律ソフトではありません。公開例のロボット、カメラ、行動次元を自分のG1・Z1構成と照合してから選びます。

WMAとVLAでは学習の中心が異なる

UnifoLM-WMA-0はワールドモデルを、未来の相互作用映像を作る対話型シミュレーションと、予測を行動ヘッドへつなぐ意思決定の二つに使います。必要なモードだけで学習する構成も示されています。

UnifoLM-VLA-0は視覚言語バックボーンをロボット操作データで継続学習し、行動を予測します。新旧ではなく、未来映像と直接行動のどちらが研究仮説の中心かで判断します。

判断項目UnifoLM-WMA-0UnifoLM-VLA-0
中心の役割世界予測と行動の結合視覚・言語から行動
公開モードシミュレーション・意思決定シミュレーション評価・実機推論
例示データZ1・双腕Z1・G1G1操作12種類
向く研究未来ロールアウト・方策補強直接操作方策

データセットのロボット形態と作業は共通ではない

WMAリポジトリはZ1、双腕Z1、G1の主要5データセットと追加のG1器用腕データを掲載しています。公式Dualチェックポイントは、五つのUnitreeデータで意思決定・シミュレーションの両モードを調整したものです。

VLAリポジトリは積み上げ、梱包、拭き掃除、タオル畳みなど十二のG1操作データを使います。G1という名称が一致しても、ハンド、カメラ校正、行動表現まで同じとは限りません。

学習手順は実機へ接続する前から分かれる

WMAは動画生成モデルをワールドモデルとして適応し、その後に下流データで意思決定とシミュレーションを追加学習します。状態、行動、カメラ入力をデータに合わせる作業は残ります。

VLAはLeRobotデータをHDF5、RLDSへ変換し、データセットと混合比を登録して、行動チャンク、状態次元、正規化を設定します。生動画から安全な方策が自動で完成する手順ではありません。

事前確認理由無視した場合
CUDA・依存関係リポジトリごとに環境が違うビルド・カーネル不整合
カメラ視点・校正WMAは主視点の制約を記載空間予測の誤り
行動・状態次元ロボット形態と一致が必要無効または危険な命令
正規化・重み学習と推論の尺度を結ぶ動作量のずれ
屋内イベント会場に立つUnitree G1ヒューマノイド
これはUnitree G1の実写ですが、UnifoLM-WMAまたはUnifoLM-VLAが動作していることを示すものではなく、Z1アームも写っていません。 出典: Sayanesy / Wikimedia Commons. ライセンス: CC0 1.0.

実機例はいずれもサーバーとロボットを分ける

WMAの意思決定例はサーバーで推論し、Unitree側のクライアントが観測を送り行動を受け取ります。G1 Dex1の例には行動・観測ホライズン、制御周波数、言語指示が含まれます。

VLAもサーバー推論とロボットクライアントを案内しています。通信、モデル推論、低レベル制御は別の責任です。見る・考える・動く構成に分けると障害箇所を追いやすくなります。

比較する前に検証したい仮説を一つ決める

想像した未来が行動選択を改善するか、合成データが役立つかを調べるならWMAです。言語指示と視覚観測から操作行動を直接出す性能を調べるならVLAが合います。

同じロボット、作業、データ量、成功基準をそろえなければ数値比較はできません。直接方策はVLA評価方法、未来予測はワールドモデル解説に沿って指標を分けます。

Unitree UnifoLM-WMAとVLAの違い:G1・Z1の学習と実機展開の重要な確認点4項目をまとめたモバイルカード
記事で引用した公式情報と比較表を基にPhysical AI Labが制作した編集カードです。 出典: Physical AI Lab. ライセンス: Owned original.

オープンソースでも実機固有の安全確認は必要

G1・Z1へ接続する前に、コミット、モデルカード、ロボットクライアント、制御モード、非常停止、関節限界を確認します。オフライン再生とシミュレーションを先に通してください。

全てのUnitreeオプションに無変更で対応することや、安全認証済みの層を提供することは約束されていません。ハードウェア、ファームウェア、コミットを結果に残し、研究デモをサポート済み製品構成と混同しないようにします。

よくある質問

UnifoLM-WMAはシミュレーターだけですか?

いいえ。対話型シミュレーションに加え、ワールドモデルを行動ヘッドへつなぐ意思決定モードと実機例も公開しています。

UnifoLM-VLAは全てのG1で動きますか?

G1データと実機手順はありますが、カメラ、ハンド、行動次元、正規化、制御器、チェックポイントを実機構成に合わせる必要があります。

最初にどちらを選べばよいですか?

未来映像・ワールドモデル行動の研究ならWMA、視覚言語から直接操作する方策ならVLAを選び、最も近い公開例から再現します。

確認した公式情報

最終確認:2026年8月7日