Gemini Robotics ER 2は、Google DeepMindが2026年7月30日に発表したロボット向け視覚言語モデル(VLM)です。映像の変化を追いながら目標を分解し、ロボットAPIなどのツールを選び、作業の進み具合を判断します。
要点は、ER 2が関節角やトルクを直接出す制御器ではないことです。上位の「考える・見守る」層であり、実際の動作はVLA、ロボットSDK、制御器が受け持ちます。基礎用語はVLAとVLMの違いと見る・考える・行動するループで補えます。
ER 2はロボットの上位オーケストレーター
Googleの公式モデルカードでは、ER 2はGemini 3.5 Flashを基盤とするVLMと説明されています。テキスト、画像、動画、音声を受け取り、テキストや関数呼び出しを返すモデルです。
アプリ側が「棚まで移動」「対象を確認」「把持する」といった関数を公開すると、ER 2は状況に応じて呼び分けます。ただし実行前の引数検証、速度制限、禁止領域、停止処理はロボット側に残ります。
役割を混同すると、デモで成功した推論を安全な運動制御と誤認します。ER 2の位置は、次の表の最上段です。
| 層 | 主な出力 | 担当 |
|---|---|---|
| Gemini Robotics ER 2 | テキスト、関数呼び出し | 状況理解、計画、進行監視 |
| VLA・行動方策 | 数値のロボット行動 | 指示を動作へ変換 |
| 制御器 | モーター指令 | 時間制約の厳しい実行 |
| 安全系 | 停止・制限 | 人と設備の保護 |
ER 1.6から強まったのは時間軸の理解
静止画から物体を見つけるだけでは、長い作業のどこまで終わったかは分かりません。ER 2は連続する映像から、把持した、落とした、人が近づいた、といった変化を読み、次の手順を選ぶ設計です。
Gemini Robotics ER 1.6の解説も身体化推論やツール利用を扱いますが、ER 2の発表では継続的な動画理解、作業進行の追跡、複数ロボットの協調が前面に出ました。旧モデルの記事をER 2で上書きするのではなく、世代差として読むのが適切です。
Googleの非推奨モデル一覧では、ER 1.6の停止日は2026年8月31日です。利用者はモデルID、対応機能、出力形式を実環境で確認してから移行すべきです。
| 確認点 | ER 1.6 | ER 2 |
|---|---|---|
| 位置づけ | 旧世代のプレビュー | 最新の公開プレビュー |
| 注目機能 | 身体化推論と計画 | 継続動画、進行監視、協調 |
| 運動出力 | 直接は出さない | 直接は出さない |
| 移行 | 停止予定を確認 | 再評価して採用 |
Googleの評価値は何を示すのか
発表記事によると、Googleの評価で進行状況の分類は57.4%、作業中の重要な瞬間を見つける評価は91.3%でした。後者の平均絶対時間差は0.96秒、実行速度は従来比4倍と報告されています。
これはGoogleが定めた条件でのモデル評価であり、工場、家庭、倉庫での成功率ではありません。カメラ位置、照明、関数設計、通信遅延、ロボット本体が変われば結果も変わります。
導入判断では、完了判定の誤り、再試行、人の介入率、停止までの時間を自社の作業で測ります。数字は有望さの手掛かりであって、現場保証ではありません。
| Googleの評価項目 | 報告値 | 読み方 |
|---|---|---|
| 進行状況の分類 | 57.4% | 定義済み評価での分類性能 |
| 重要な瞬間の検出 | 91.3% | イベントを見つけた精度 |
| 平均絶対時間差 | 0.96秒 | 検出時刻のずれ |
| 実行速度 | 4倍 | Google比較条件での速度 |

ツール呼び出しと複数ロボット協調
ER 2は検索、コード実行、関数呼び出しなどを計画に組み込めます。ロボットでは、移動、撮影、把持、状態照会を狭い関数として登録し、モデルの要求をアプリが検証して実行する形が基本です。
GoogleはApptronik Apollo 2とFranka F3 Duoが分担する研究デモも示しました。異なるロボットを一つの推論層が扱える可能性を見せた一方、共通規格の完成や市販システムの提供を意味しません。
Googleのモデル群とパートナー関係はGoogleのフィジカルAI戦略で俯瞰できます。個別のデモだけでなく、クラウド推論、ローカル行動、ロボットAPIの接続を見ると構造が明確です。
現在使えるのは標準版とストリーミング版
2026年8月6日時点で、標準のgemini-robotics-er-2-previewと、Live APIを使うgemini-robotics-er-2-streaming-previewが公開プレビューです。Google AI StudioとGemini APIから試せます。Enterprise Agent Platformは別枠のプライベートプレビューです。
標準版は構造化出力、コード実行、キャッシュなど幅広い機能を扱い、判断点ごとに問い合わせる処理に向きます。ストリーミング版は観測を継続して渡す対話に向きますが、サーボ制御のような決定論的リアルタイム処理を置き換えません。
料金と機能差はER 2の料金・APIガイドで分けて確認してください。プレビュー中はモデル名、対応ツール、価格が変わる前提で設計します。

安全性とプレビューの限界
モデルカードは、故障が死亡、負傷、物的損害につながる安全重要用途にER 2を使わないよう示しています。誤認や不適切な関数選択に備え、独立した非常停止と安全制御が欠かせません。
ロボットの映像や音声が識別可能な人を含む場合は、適用法令と組織の規程に従って通知・同意の要否を確認します。無料サービスには機密情報や個人情報を送らず、顔ぼかしや無人区域での運用など、収集量を減らす設計も必要です。
ER 2は完成品のロボットでも、認証済みの自律制御でもありません。On-Device 2の解説と役割を比べ、自分のシステムでどの層が不足しているかを先に整理しましょう。
よくある質問
Gemini Robotics ER 2はVLAですか?
いいえ。GoogleはER 2を身体化推論向けのVLMとして説明しています。テキストや関数呼び出しで上位計画を返し、数値のロボット行動はVLAや制御器が担当します。
Gemini Robotics ER 2は今すぐ試せますか?
はい。標準版とストリーミング版は2026年8月6日時点でGemini APIとGoogle AI Studioの公開プレビューです。ただしプレビュー仕様や価格は変更され得ます。
ER 2を接続すればどのロボットも自律化しますか?
しません。利用するロボットAPI、行動方策、制御、関数検証、安全系を開発側が用意する必要があります。公式デモは汎用互換性や安全認証を証明していません。
確認した公式情報
- Google:Gemini Robotics ER 2発表
- Google DeepMind:Gemini Robotics ER 2モデルカード
- Google AI for Developers:ER 2モデル情報
- Google AI for Developers:非推奨モデル
- Google DeepMind:Gemini Robotics 2安全性レポート
最終確認:2026年8月6日