Gemini Robotics-ER 1.6:空間推論、API出力、ロボット統合

バージョン更新: Googleは、従来のgemini-robotics-er-1.6-previewを2026年8月31日に終了する予定です。後継のGemini Robotics ER 2は現在パブリックプレビューで提供されています。新しいモデルID、料金、移行時の確認事項はER 2の料金・APIガイドをご覧ください。終了日はGemini APIの公式変更履歴に基づき、以下の本文はER 1.6の記録として残しています。

Gemini Robotics-ER 1.6は、視覚的および言語的理解とロボティクスに役立つ空間的出力を結びつけるための身体推論モデルです。物体、領域、軌道、計画について推論することはできますが、校正された知覚、動作計画、低高度制御や安全システムの代わりにはなりません。

工学的な問題は、確率モデルの出力がどのようにして決定論的なロボットスタックに移行するかです。座標にはフレームとスケールが必要で、計画には到達可能性や衝突チェックが必要で、アクションには限界、フィードバック、シーンやモデルの仮定が誤った場合の回復が必要です。

このガイドは 、Physical AI制御ループGR00Tモデルガイドを補完します。製品へのアクセス、機能、制限、APIの挙動が変わる可能性があるため、現在の一次ドキュメントを確認してください。

ERは低レベルのアクチュエーションよりも身体的推論を重視します

Google DeepMindの モデルカード は、Gemini Robotics-ER 1.6を空間的および身体的推論能力を持つ視覚言語モデルとして説明しています。ロボット応用のための知覚や計画の質問をサポートできます。

その成果は提案書や構造化された情報のままです。ロボットシステムはそれらを検証し、変換し、実行する方法を決定しなければなりません。点や箱、軌道を運動指令として記述しないでください。

入力はタスクを露出させ、前提を調整するべきです

画像、映像フレーム、言語指示、関連する文脈がモデルの視点を定義します。カメラの本質的要素、ポーズ、トリミング、タイムスタンプ、シーンの変化は、出力が物理空間にどのようにマッピングされるかに影響を与えます。

正確なプロンプト、モデル識別子、API設定、入力前処理を記録します。ロボットの状態や工具の形状が提供されていなければ、モデルがそれを知っていると仮定することはできません。下流のソフトウェアが消費するすべてのスキーマをバージョン化してください。

シーン理解を空間点とロボットの軌道に変換した公式例
公式の例はロボティクスの空間的に根ざした推論を示しています。これはモデルが低レベルのモーターを直接駆動するという意味ではありません。出典: Google AI for Developers。ライセンス情報: CC BY 4.0サイトポリシー

接地されたポイントやボックスには座標コントラクトが必要です

モデルは画像のポイント、領域、または物体の位置を識別できます。下流のコードは、座標がピクセル、正規化された値、カメラフレーム位置、または他の慣習であるかを把握しなければなりません。画像のサイズ変更と向きは一貫していなければなりません。

既知のマーカーやオブジェクトに対して座標を検証します。境界外、曖昧さ、または信頼度の低い出力は拒否してください。視覚的にもっともらしいオーバーレイでも、把握には韻律的に誤りがあることがあります。

出力有用必要な変換クリティカルチェック
ポイントか箱か物体接地画像座標マッピング境界と同一性
奥行きまたは幾何学空間的関係カメラのキャリブレーションとスケールメートル誤差
軌跡概要意図または経路のヒント時間とロボットフレーム衝突と到達の容易さ
タスクプランアクションシークエンススキルと状態マッピング前提条件と回復

空間的推論は、校正された幾何学と調和させる必要があります

ロボット計画はカメラモデル、変換、運動学、環境幾何学を用います。モデルの意味理解は対象や関係を選択でき、キャリブレーションされた知覚は計量的な姿勢や不確実性を提供します。

形状をモデル推定値に無言に置き換えるのではなく、明示的にソースを融合させること。すべての変換と観測にタイムスタンプを入れてください。動的シーンでは、推論後に人や物体が動く可能性があるため、実行前に確認が必要です。

公式な例がインターフェース境界を示しています

公式のロボティクス文書は、モデル出力がどのようにシーン要素や軌道を記述できるかを示しています。これらの例は、任意のロボットやカメラ、タスク間の成功を保証するものではなく、可能なAPIインタラクションの定義に役立ちます。

ピン留めされた入力で例を再現し、掲げられた物体、照明、雑多、視点をテストします。有効な出力と棄却・失敗行動の両方を測定してください。デモンストレーションは再現可能なテストに変換されるべきです。

Gemini Robotics ERの推論からロボット実行までの5段階境界
グラウンディングされたモデル出力は、ハードウェアが動作する前に検証、モーションプランニング、ガード実行に入ります。出典:Physical AI Lab。

計画は制約されたスキルライブラリにマッピングされるべきです

ピック、プレイス、オープンといった言語レベルの計画は、定義されたパラメータ、前提条件、限界、成功判定を持つスキルに限定されるべきです。自由なテキストは、制限のないロボットの動きに直接渡すべきではありません。

執行層はパラメータが欠落した場合に説明、再観察、停止を要求できます。スキルは検証済みの結果と失敗コードを報告し、モデルやプランナーが完了を想定しないよう。

動作計画と制御は安全境界として別々のままです

地上の目標は逆運動学、衝突判定、軌道生成、低高度制御に入ります。関節制限、速度、力、作業空間、保護区域はモデルの提案とは独立して執行されます。

知覚とロボットのフィードバックで実行を監視します。再計画は限られたルール内でのみ;それ以外は安全に停止してください。安全評価機能は、適切なアーキテクチャで特に検証されない限り、一般的なモデルの外に置かれるべきです。

失敗検出即時対応工学的証拠
間違った物本人確認処刑しないでください混乱行列と試行
フレームミスマッチ幾何学の合理性チェック出力を拒否する校正試験
到達不能の目標運動学チェックリクエスト代替案到達可能性のカバレッジ
衝突経路プランナーチェックブロック軌道シナリオスイート
場面が変わった新たな観察停止するか、計画を立て直すかレイテンシーと動的テスト

評価にはタスク分母と失敗分類が必要

成功例だけでなく、有効な試行数を数えましょう。物体の接地、空間精度、計画の妥当性、動作の実現可能性、実行成功、回復を分離しています。最終的な課題の失敗はどの層でも始まることがあります。

長引かせられたシーンや、コントロールされた変化を伴った繰り返しの試練を使いましょう。介入、レイテンシ、無効出力率および棄却率の報告。同じワークフローに対して、より単純な知覚やスクリプト化されたベースラインと比較してください。

遅延、コスト、プライバシーは展開に影響します

クラウドAPIコールはネットワーク遅延、可用性、データガバナンスに関する疑問を生み出します。ローカルの前処理やキャッシュは効果的ですが、古臭い状態を生むべきではありません。サービスが利用できない場合にはタイムアウトと定義された動作が必要です。

モデルレイテンシだけでなく、エンドツーエンドの意思決定時間とタスク価値を測定してください。職場や人からの画像に関するデータの保持、アクセス制御、地域ごとの要件を見直しましょう。現在の勤務期間は配属前に必ず確認してください。

プログレッシブな統合経路はハードウェアリスクを低減します

まず録画映像とオフラインスコアリングから始め、その後シャドウモード、シミュレーション、そしてガードロボットのセットアップを使いましょう。タスクや速度を拡大する前に、すべての境界で決定論的な検証を要求します。

プロンプト、スキーマ、キャリブレーション、テスト、ログをバージョン管理された成果物として維持してください。このモデルは、ロボットが制限された制御と安全な回復を維持しつつ、検証済みのタスク成果を基準線を超えて改善する際に有用です。

  • ピンモデル、プロンプト、出力スキーマ。
  • 座標、フレーム、スケールを定義してください。
  • ジオメトリ、到達可能性、衝突を検証します。
  • 実行は限定スキルと操作のみで行いましょう。
  • 故障、遅延、介入、回復を測定します。

よくある質問

Gemini Robotics-ER 1.6とは何ですか?

これは、ロボティクスの応用に役立つ空間的に根ざした理解を提供することを目的とした、身体的推論型の視覚言語モデルです。

Gemini Robotics-ERはモーターを直接制御していますか?

単独ではそうではありません。出力は幾何学的検証、計画、低レベル制御、独立した安全限界を通過する必要があります。

ロボティクスモデルはどのようなグラウンド出力を提供できるのでしょうか?

現在のAPIによっては、ポイント、地域、空間関係、軌道、構造化されたタスクプランなどが例として挙げられます。

ERの出力はどのように評価すべきでしょうか?

実施された繰り返し試験におけるグラウンディングの精度、協調妥当性、計画の実現可能性、課題の成功、レイテンシー、介入、失敗回復を測定します。

ロボットの安全システムの代わりになるのでしょうか?

いいえ。安全機能は、一般的な確率的モデル出力に依存しない、ハザードベースのアーキテクチャと検証済みの保護機構を必要とします。

モデルおよびAPIバージョンノート

モデルの利用可能性、アクセス、APIスキーマや能力は変化する可能性があります。現在の公式モデルカードとドキュメント、ピンバージョンを確認し、ジオメトリ、制御、安全検証は信頼できないモデル出力の外に保管してください。