GoogleのフィジカルAIとは:Gemini Robotics ER 2とロボット戦略

GoogleのフィジカルAIを「Google製ロボットの発売」と捉えると全体像を見誤ります。中心は、現実世界を理解して計画するER 2、機体上で動作を出すOn-Device 2、他社の機体やAPIをつなぐソフトウェア層です。

つまりGoogleが提供しているのは、一台の万能ロボットではなく、見る・考える・道具を選ぶためのモデル群です。フィジカルAIの基本VLAの仕組みを押さえると、各モデルの役割を混同せずに読めます。

Googleの戦略はロボット本体より知能の層にある

Googleの公式発表は、ER 2を複雑な作業の計画、ツール利用、進行監視を担う高水準の推論モデルとして位置づけています。移動や把持は、接続先のロボットAPIや行動モデルが実行します。

この構造なら、四足歩行ロボット、固定アーム、ヒューマノイドなど異なる機体に、共通の高水準推論を重ねられます。ただし接続用の関数、権限、安全規則、失敗時の回復は機体ごとに必要です。

検索でよく見かける「Googleロボット」という表現は便宜的です。現在確認できる公開情報から、Googleが一般消費者向けの完成ロボットを販売しているとは言えません。

構成要素役割現在の形
Gemini Robotics ER 2理解、計画、進行監視Gemini APIの公開プレビュー
Gemini Robotics On-Device 2ローカルで数値行動を出力Trusted Testers
ロボットAPI・SDK移動や把持を実行各メーカー・開発者が提供
安全・制御層停止、速度、範囲を管理導入側が設計

ER 2はクラウド側の高水準推論

Gemini Robotics ER 2は、テキスト、画像、動画、音声を受け、テキストと関数呼び出しを返すVLMです。動画から作業の状態を追い、必要なツールを選ぶ点が核になります。

標準APIは計画や構造化出力を組み立てる処理、ストリーミング版は観測を継続して渡す処理に向きます。どちらもモーターを直接駆動するリアルタイム制御器ではありません。

クラウドの知識や検索と結びつけられる反面、通信遅延、利用料金、映像データの扱いを考える必要があります。安全停止や衝突回避をネットワーク越しの生成モデルだけに任せる設計は避けます。

On-Device 2はロボット上の行動モデル

Gemini Robotics On-Device 2は、テキスト、画像、ロボットの自己状態を受け、数値の行動を返すVLAです。ネットワーク条件が厳しい場所でも、機体側で推論する方向を示します。

Google DeepMindの公式ページは、200件未満の例と数時間の学習で新しい機体に適応した結果を紹介しています。これは同社の評価条件であり、全ロボットへの保証ではありません。

2026年8月6日時点では一般公開APIではなくTrusted Testers向けです。ER 2が公開されているからといって、On-Device 2の重みやSDKを誰でも取得できるわけではありません。

比較ER 2On-Device 2
モデル種別VLMVLA
主な出力テキスト、関数呼び出し数値のロボット行動
主な実行場所Gemini APIロボット上
アクセス公開プレビューTrusted Testers
中心課題計画と監視動作生成
NISTのロボット試験施設
フィジカルAIの評価にはモデルだけでなく、施設・センサー・手順・機体が必要です。Googleの施設を写したものではありません。 出典: NIST / A. Eustis via Wikimedia Commons. ライセンス: Public domain, U.S. Government work.

パートナーロボットは戦略を映す実験場

GoogleはBoston Dynamics Spotに自然言語でポップコーンを取りに行かせる例を公開しました。ER 2が状況を理解し、Spotの移動・マニピュレーターAPIを呼ぶ構成で、機体そのものをGoogleが製造したわけではありません。

Apptronik Apollo 2とFranka F3 Duoの協調デモでは、異なる身体を持つロボットへ作業を分配しました。狙いは一つの機体に閉じず、能力の違うロボットを上位モデルから扱うことにあります。

SpotとER 2のデモ構造を読む際も、研究デモと商品化を分ける必要があります。公式発表は商用統合、導入価格、一般提供時期を示していません。

公式デモ機体示したこと示していないこと
物を取りに行くBoston Dynamics Spot自然言語からAPIを編成完成した商用統合
複数ロボット協調Apollo 2+Franka F3 Duo役割分担と引き継ぎ汎用の相互運用規格
継続動画理解複数の評価環境進行状態の追跡全現場での成功率

開発者が使える範囲と待つ範囲

ER 2の標準版とストリーミング版は、Google AI StudioとGemini APIで試せます。Enterprise Agent Platform上の提供はプライベートプレビューです。用途によって公開経路が違うため、「GoogleのロボットAIは公開済み」と一括りにできません。

On-Device 2はTrusted Testers、SpotやApolloの例は研究デモです。公開APIで検証できる範囲、申請が必要な範囲、動画でしか確認できない範囲を分けると、導入可能性を過大評価しにくくなります。

APIを試す場合も、ロボットの関数を最小権限で定義し、呼び出し前の検証と独立停止系を置きます。モデルの賢さより、許可された行動の狭さが安全性を左右する場面は少なくありません。

GoogleのフィジカルAIとは:Gemini Robotics ER 2とロボット戦略の要点を整理した判断カード
Googleの公式情報を基にPhysical AI Labが再構成した編集カードです。 出典: Physical AI Lab. ライセンス: Owned original.

今後見るべき三つの指標

第一は介入率と失敗回復です。連続作業で何回人が助けたか、誤った完了判定から戻れたかを見ます。第二は機体ごとの接続コストで、必要な関数定義や学習例を数えます。

第三は公開条件です。On-Device 2の提供範囲、ER 2のプレビュー仕様、パートナーとの商用展開が変われば、Googleの戦略は研究から製品へ一段進んだと判断できます。

現時点では、Googleの強みは消費者向けロボットの販売台数ではなく、Geminiの推論を多様な身体と接続する試みにあります。モデル、API、機体、制御、安全を一つのシステムとして追うのが適切です。

よくある質問

Googleは家庭用ロボットを発売したのですか?

確認できる公式情報では、Gemini Robotics ER 2などのモデルとAPI、パートナー機体での研究デモが中心です。一般消費者向け完成ロボットの発売発表ではありません。

GoogleのフィジカルAIで中心になるモデルは何ですか?

上位推論のER 2と、ロボット上で行動を出すOn-Device 2が異なる層を担います。前者は公開プレビュー、後者はTrusted Testers向けです。

SpotやApolloはGoogle製ロボットですか?

いいえ。SpotはBoston Dynamics、ApolloはApptronikの機体です。GoogleはER 2による計画やAPIオーケストレーションの研究例として用いています。

確認した公式情報

最終確認:2026年8月6日