Boston Dynamics SpotとGemini Robotics ER 2:物を運ぶデモの仕組み
Spotの物を運ぶデモでは、ER 2が高水準の計画とAPI選択を担い、Spotの既存機能が移動とマニピュレーター操作を実行しました。
VLAとロボット基盤モデルの仕組みを解説します。
Spotの物を運ぶデモでは、ER 2が高水準の計画とAPI選択を担い、Spotの既存機能が移動とマニピュレーター操作を実行しました。
On-Device 2はロボット上で数値行動を出すローカルVLAです。公開Gemini APIではなく、2026年8月時点ではTrusted Testers向けです。
ER 2はAI StudioとGemini APIで試せます。標準版とストリーミング版は同じトークン単価でも対応機能が異なり、ロボット本体の価格とは別です。
Gemini Robotics ER 2は、ロボットの状況を動画で追い、計画やツール呼び出しを担う上位の視覚言語モデルです。モーターを直接動かすVLAではありません。
GoogleのフィジカルAIは単一の家庭用ロボットではなく、上位推論、ローカル行動、API、パートナー機体を組み合わせるモデル中心の戦略です。
Isaac GR00T N1.7アーキテクチャ、データフォーマット、エンボディメントタグ、ファインチューニング、推論、評価、ハードウェア検証 NVIDIA 解説します。
ロボティクスにおける VLA モデルと VLM モデルを比較し、出力、行動データ、フィードバック、身体化、評価、自律性主張の限界などを含みます。
ロボット基盤モデルの意味、学習データ、Cross-Embodiment、VLAとの違い、追加学習と実機評価を解説。汎用性という言葉に頼らず、導入前に確認すべき証拠を整理します。
VLA(Vision-Language-Action)とは何かをロボット視点で解説。視覚と言語から行動を出す仕組み、学習データ、VLMとの違い、評価指標、実機導入時の限界を整理します。