MolmoAct 2はモデル名ではなく機体と行動スキーマで選びます。公式リポジトリはMolmoAct2とThinkを追加適応用の基盤チェックポイント、DROID、BimanualYAM、SO100/101、LIBEROを特定用途の微調整モデルとして分けています。
新しい機体はBaseを基準にし、3D構造についての深い推論が実際のボトルネックならThinkを比較します。対象がFranka DROID、YAM、SOアーム、LIBEROに近くてもカメラ、状態、制御表現を先に合わせます。ロボット基盤モデルの適応範囲も参考になります。
機体・スキーマ・作業と推論の深さで絞る
実機かシミュレーションか、単腕・双腕・SOアームか、関節位置か手先姿勢か、より深い推論に計算時間を割く理由があるかを確認します。
Baseも万能配備方策ではありません。関節順、カメラ順、正規化、単位が違えば同じ構造でも実行できません。
| チェックポイント | 用途 | 近い対象 | 注意 |
|---|---|---|---|
| MolmoAct2 | 微調整基盤 | 新機体・新作業 | 追加データが必要 |
| MolmoAct2-Think | 深い推論向けの基盤 | 3D関係が重要 | 計算と遅延測定 |
| DROID | 推論・追加学習 | Franka DROID | 絶対関節姿勢 |
| BimanualYAM | 双腕 | YAM | カメラ順と14次元状態 |
| SO100_101・LIBERO | 対象データ・評価 | SOアーム・LIBERO | 実機とシミュレーションを区別 |
Baseは出発点であり、そのまま使える制御器ではない
Baseは、連続値のフローマッチング型アクションエキスパートを備えた事後学習済みの基盤モデルとして説明され、対象ロボットに適応する標準出発点です。
新しいグリッパーへ直結すると次元、単位、正規化、安全範囲がずれます。VLA入門で説明した通り、アクション表現は機体ごとに異なります。
Thinkは必要な場面でより深く推論する
Ai2公式発表は深度トークンと適応的な深度予測を説明します。遮蔽、挿入、空間関係が難しい作業で候補になります。
全作業で有利とは限りません。同じデータと機材でBaseと成功率、p95遅延、復旧を比較します。

用途別モデルはスキーマが一致して初めて強い
DROIDはFrankaの絶対関節姿勢、YAMは双腕、SO100_101はSO機体、LIBEROは各スイート混合に合わせています。
関節順、状態次元、カメラ名と順、グリッパー、周期、正規化を比較し、不一致には変換か追加学習を用意します。
| 層 | 一致項目 | 無視した危険 |
|---|---|---|
| 機体 | 関節数・順・範囲 | 誤関節命令 |
| 観測 | カメラ数・順・解像度 | 視点混同 |
| 状態 | 次元・単位・座標 | 正規化誤り |
| 行動 | 関節・手先・グリッパー表現 | 制御不一致 |
| 時間 | 周期・action horizon | 遅延と不安定 |
実行要件を固定してからGPUを選ぶ
公式モデルカードとリポジトリはモデル情報、依存関係、dtype、サーバースキーマを示します。版を記録して再確認します。
目標dtype、カメラ数、解像度、action horizonでピークメモリと遅延を測り、単一の目安でGPUを決めません。

ベンチマークは著者報告の範囲で読む
論文は7つのシミュレーション・実機評価と13の身体推論評価を報告し、ブログはLIBEROでBase 97.2%、Think 98.1%を示します。
別機体の保証ではありません。VLA評価ガイドに沿い、全試行、失敗、介入、遅延を同条件で測ります。
安全な選択はスキーマ検証から始める
観測・状態・行動を文書化し、オフラインで次元と単位、シミュレーションで制限と停止、実機で低速・低力を順に確認します。
速度、作業空間、トルク、接触力はモデル外の安全層で制限し、非常停止と監督を維持します。
よくある質問
新しいロボットはBaseとThinkのどちらから始めますか?
まずBaseで基準を作り、深度や遮蔽が実測ボトルネックならThinkを同条件で比較します。どちらも対象機体への適応が必要です。
DROIDモデルを別の腕で直接使えますか?
通常は困難です。Franka型の絶対関節姿勢と特定スキーマを前提とするため、関節、座標、グリッパー、正規化を確認します。
LIBERO 98.1%は実機でも再現しますか?
保証しません。Ai2が報告したLIBEROでの結果であり、実機のセンサー、接触、遅延、安全、復旧は別評価です。
確認した公式情報
最終確認日:2026年8月7日