未来の相互作用を予測したい、合成ロールアウトを作りたい、ワールドモデルで行動方策を補強したい場合はUnifoLM-WMA-0が候補です。視覚と言語から操作行動を直接学習・評価したい場合はUnifoLM-VLA-0が近い出発点です。
どちらもコードと重みを公開した研究リポジトリであり、全てのUnitreeロボットにそのまま入る商用自律ソフトではありません。公開例のロボット、カメラ、行動次元を自分のG1・Z1構成と照合してから選びます。
WMAとVLAでは学習の中心が異なる
UnifoLM-WMA-0はワールドモデルを、未来の相互作用映像を作る対話型シミュレーションと、予測を行動ヘッドへつなぐ意思決定の二つに使います。必要なモードだけで学習する構成も示されています。
UnifoLM-VLA-0は視覚言語バックボーンをロボット操作データで継続学習し、行動を予測します。新旧ではなく、未来映像と直接行動のどちらが研究仮説の中心かで判断します。
| 判断項目 | UnifoLM-WMA-0 | UnifoLM-VLA-0 |
|---|---|---|
| 中心の役割 | 世界予測と行動の結合 | 視覚・言語から行動 |
| 公開モード | シミュレーション・意思決定 | シミュレーション評価・実機推論 |
| 例示データ | Z1・双腕Z1・G1 | G1操作12種類 |
| 向く研究 | 未来ロールアウト・方策補強 | 直接操作方策 |
データセットのロボット形態と作業は共通ではない
WMAリポジトリはZ1、双腕Z1、G1の主要5データセットと追加のG1器用腕データを掲載しています。公式Dualチェックポイントは、五つのUnitreeデータで意思決定・シミュレーションの両モードを調整したものです。
VLAリポジトリは積み上げ、梱包、拭き掃除、タオル畳みなど十二のG1操作データを使います。G1という名称が一致しても、ハンド、カメラ校正、行動表現まで同じとは限りません。
学習手順は実機へ接続する前から分かれる
WMAは動画生成モデルをワールドモデルとして適応し、その後に下流データで意思決定とシミュレーションを追加学習します。状態、行動、カメラ入力をデータに合わせる作業は残ります。
VLAはLeRobotデータをHDF5、RLDSへ変換し、データセットと混合比を登録して、行動チャンク、状態次元、正規化を設定します。生動画から安全な方策が自動で完成する手順ではありません。
| 事前確認 | 理由 | 無視した場合 |
|---|---|---|
| CUDA・依存関係 | リポジトリごとに環境が違う | ビルド・カーネル不整合 |
| カメラ視点・校正 | WMAは主視点の制約を記載 | 空間予測の誤り |
| 行動・状態次元 | ロボット形態と一致が必要 | 無効または危険な命令 |
| 正規化・重み | 学習と推論の尺度を結ぶ | 動作量のずれ |

実機例はいずれもサーバーとロボットを分ける
WMAの意思決定例はサーバーで推論し、Unitree側のクライアントが観測を送り行動を受け取ります。G1 Dex1の例には行動・観測ホライズン、制御周波数、言語指示が含まれます。
VLAもサーバー推論とロボットクライアントを案内しています。通信、モデル推論、低レベル制御は別の責任です。見る・考える・動く構成に分けると障害箇所を追いやすくなります。
比較する前に検証したい仮説を一つ決める
想像した未来が行動選択を改善するか、合成データが役立つかを調べるならWMAです。言語指示と視覚観測から操作行動を直接出す性能を調べるならVLAが合います。
同じロボット、作業、データ量、成功基準をそろえなければ数値比較はできません。直接方策はVLA評価方法、未来予測はワールドモデル解説に沿って指標を分けます。

オープンソースでも実機固有の安全確認は必要
G1・Z1へ接続する前に、コミット、モデルカード、ロボットクライアント、制御モード、非常停止、関節限界を確認します。オフライン再生とシミュレーションを先に通してください。
全てのUnitreeオプションに無変更で対応することや、安全認証済みの層を提供することは約束されていません。ハードウェア、ファームウェア、コミットを結果に残し、研究デモをサポート済み製品構成と混同しないようにします。
よくある質問
UnifoLM-WMAはシミュレーターだけですか?
いいえ。対話型シミュレーションに加え、ワールドモデルを行動ヘッドへつなぐ意思決定モードと実機例も公開しています。
UnifoLM-VLAは全てのG1で動きますか?
G1データと実機手順はありますが、カメラ、ハンド、行動次元、正規化、制御器、チェックポイントを実機構成に合わせる必要があります。
最初にどちらを選べばよいですか?
未来映像・ワールドモデル行動の研究ならWMA、視覚言語から直接操作する方策ならVLAを選び、最も近い公開例から再現します。
確認した公式情報
- Unitree UnifoLM-WMA-0公式リポジトリ
- Unitree UnifoLM-VLA-0公式リポジトリ
- Unitree UnifoLM-WMA-0 Dual公式モデル
- Unitree UnifoLM-VLA Base公式モデル
最終確認:2026年8月7日