Physical Intelligence π0.7とは:指示で動き方を調整できるVLA

Physical Intelligenceの公式π0.7研究記事が説明するπ0.7は、作業目標だけでなく実行方法も条件付けできるVLAです。途中の言語指示、品質や速度などの戦略情報、将来状態を示すサブゴール画像によって、同じ作業でも望む進め方を指定します。

同社は、未知タスクの組み合わせ、異なるロボット形態への転移、特定作業で専門モデルに並ぶ結果を報告しています。ただし評価されたロボットと作業の範囲内で読む必要があります。基本用語はVLAとVLMの比較で確認できます。

調整可能とは目標とやり方を一緒に渡せること

「台所を片付ける」という指示だけでは順番や速さが曖昧です。π0.7は次の行程を示す言葉、品質や速度のメタデータ、視覚的なサブゴールを受け取り、混在する戦略を区別します。

通常の会話プロンプトでモーター値を直接変更する仕組みではありません。学習時からこれらの文脈を含めたり省いたりすることで、行動方策が条件に応じて変わるように訓練されています。

文脈信号指定する内容
タスク指示全体の目標カウンターを拭く
サブタスク言語次の意味的段階引き出しを開ける
エピソード情報品質・速度・戦略速く確実なやり方
サブゴール画像近い未来の見た目望む物体配置

成功例だけでなく多様な経験を文脈付きで学ぶ

論文ではロボット実演、自律実行の失敗を含むエピソード、人の一人称動画、ウェブのマルチモーダルデータを使っています。細かな文脈ラベルが、異なる戦略を曖昧に平均化する問題を抑えます。

π0.7はπ*0.6・Recap系とMEM系を発展させ、VLMバックボーン、動画履歴メモリー、行動エキスパートを組み合わせます。軽量ワールドモデルが作るサブゴール画像は、言葉にしにくい空間情報を補います。

言語コーチングと後の自律実行を混同しない

π0.7論文のエアフライヤー実験では、短いゼロショット指示だけの試行は途中までしか進みませんでした。段階的な言語コーチングで改善し、その記録を上位方策の追加学習に使った後、サブタスクを自動生成しました。

つまり、人が教えながら動かした試行と、その後に自律実行した試行は別の証拠です。前者を示して基礎モデルが最初から全手順を独立に計画したと説明すると誤解を招きます。

公開実験示したもの残る限定
エアフライヤーコーチングで新しい機器作業を構成最初のゼロショットは未完了
双腕UR5eの洗濯物畳みそのロボットの当該データなしで転移指定形態・指定作業の条件
エスプレッソ・洗濯・箱単一モデルを専門方策と比較全操作での優位ではない
多様な言語指示細かな指示追従無制限の安全な自然言語制御ではない
複数のロボットアームが操作作業を行うOpen X-Embodiment場面集
この画像はOpen X-Embodimentの複数のロボット作業場面であり、Physical Intelligence π0.7の実験画面ではありません。π0.7のステアリング挙動や未見タスク性能を証明しません。 出典: Open X-Embodiment robot dataset scenes. ライセンス: Project license and dataset-specific terms.

未知タスクも過去に得た要素を組み合わせて解く

評価ロボットで同じ作業の実演がなくても、関連する物体、動き、意味概念は別のロボット、人、ウェブデータに含まれ得ます。構成的一般化は要素の新しい組み合わせであり、知識なしの行動ではありません。

指示、物体、背景、ロボット形態、作業全体のどれを未学習にしたかを確認してください。VLA評価ガイドのように分割条件を明示すると主張の強さを比較できます。

研究公開と一般向け商用APIは別の段階

2026年4月の記事と論文は構造と実験を説明し、研究・応用の協力先を募っています。誰でも即時利用できる商用API、全対応ロボット一覧、稼働保証を発表したものではありません。

導入検討ではモデルへのアクセス条件、計算資源、制御周期、安全インターフェース、ロボット固有の適応を確認します。論文と動画が公開されたことを製品発売と読み替えてはいけません。

Physical Intelligence π0.7とは:指示で動き方を調整できるVLAの重要な確認点4項目をまとめたモバイルカード
記事で引用した公式情報と比較表を基にPhysical AI Labが制作した編集カードです。 出典: Physical AI Lab. ライセンス: Owned original.

実機試験では完了率と動き方の変化を同時に測る

目標を固定したまま速度、戦略、サブゴールだけを変える対の指示を作ります。実際の軌道が望む方向へ変わり、成功率と作業空間の制約を維持できるかを測ります。

未知の物体・環境でも反復し、復旧と介入を記録します。ロボット行動データの解説を使えば、選ばれた映像と再現可能な調整能力を分けるログを設計できます。

よくある質問

π0.7はなぜsteerableなのですか?

サブタスク言語、戦略メタデータ、サブゴール画像を学習文脈として使い、作業目標だけでなく実行方法も条件として渡せるためです。

未知タスクを全てゼロショットで完了しましたか?

いいえ。構成的一般化の初期的な兆候が報告されており、エアフライヤーの初回ゼロショット試行は未完了で、言語コーチングにより改善しました。

公開されたπ0.7 APIをすぐ使えますか?

公式記事と論文は研究と協力を案内していますが、一般向けセルフサービス商用APIは発表されていません。

確認した公式情報

最終確認:2026年8月7日