ロボット VLA 評価:タスク、一般化、レイテンシーおよび安全性のエビデンス

ロボットの視覚・言語・行動ポリシーは視覚的観察と言語指示を行動にマッピングしますが、評価は展開された全体の連鎖を観察します。カメラ、プロンプト処理、ポリシー推論、アクション変換、コントローラー、グリッパー、環境がすべて結果に寄与します。成功率だけではどの機能がうまくいったか、どの機能が失敗したかを特定することはできません。

有用なプロトコルは設定を凍結し、タスクや初期状態を定義し、慣れ親しんだ状態と変化した条件を階層化し、試験レベルの結果を記録し、不確実性を報告します。また、潜伏、介入、身体的副作用も測定します。これにより、研究ベンチマークを根拠のない安全性主張に変えることなく、モデルの改良を問わずに結果を比較可能にします。

このガイドを拡 散ポリシーガイド および アクションチャンクガイドと組み合わせて活用してください。すべての結果を単一のモデルラベルに割り当てる前に、言語の基盤、知覚、アクション生成、実行を個別に評価してください。

試験前に対象システムの構成を固定する

レコードモデルアーキテクチャ、チェックポイントハッシュ、トークナイザー、プロンプトテンプレート、画像前処理、ポリシーサンプリング設定、アクション正規化。また、ロボットのシリアル構成、カメラの内蔵および外部部品、ツール、ペイロード、コントローラーのゲイン、ファームウェアおよびソフトウェアの改訂も記録します。周囲の複数の成分が帰属なしに変化した場合、モデル比較は無効です。

ウォームアップ、リセット、キャリブレーション手順を定義してください。遅延が挙動に影響を与えるため、ピン推論ハードウェアと電源モードを選びます。環境アセットやオブジェクト識別子も保存し、一般的なカテゴリだけでなく保存してください。オンライン適応、検索、記憶が活発な場合は、その初期状態を保持し、各試行ごとに履歴を更新してください。

異なるロボットのタスクと実装にまたがる4パネルのオクトロボットポリシー評価
ジェネラリスト方針は具体化やタスクで検証可能ですが、結果は観察、行動、ロボット、評価の各セットアップに結びつきます。出典: Octo Project。コードライセンス: MITです。

タスクには開始と終了の状態が観察可能である必要があります

各命令、許可された言い換え、初期オブジェクト領域、ロボットの開始ポーズ、タイムアウト、成功述語を書きます。見た目が正しいといった判断を、測定可能な状態に置き換えましょう:標識のあるゾーン内に物体がある、引き出しが一定距離以上開いている、あるいは工具を保持している状態です。結果を観察する前に、部分的な進捗のマイルストーンを定義しましょう。

ポリシーが使う内容を指定してください。隠された人間の修正、手動のプロンプト書き換え、特権オブジェクトポーズなどがタスクを変えます。再試行回数と確認依頼を数えましょう。評価者が安全でない動きを止められる場合は、介入を結果として記録し、試験を削除しないでください。

評価層質問メートル法故障例
言語指示は地に足がついたのでしょうか?目的と関係の選択間違った物
知覚そのシーンは表現されていましたか?ポーズまたは状態のマイルストーン閉塞誤差
計画またはポリシー進歩は一貫していたのでしょうか?ステージ完成間違った順序
制御コマンドは追跡されていましたか?誤差と飽和オーバーシュート
安全行動制限は尊重されていたのでしょうか?介入と接触保護停止

慣れ親しんだ条件と変化した条件を層化する

トレーニングのような組み合わせを新しいオブジェクトインスタンス、ポーズ、背景、視点、照明、言語から分離します。作曲テストは馴染みのある名詞、関係、動作を再組み合わせることができ、難しいテストでは訓練に含まれていない概念を導入します。すべての困難な試行を一般化としてまとめるのではなく、意図したシフトにラベルを付けてください。

各層内で十分な反復を使い、ラン順をランダムにしてください。そうでなければ、一つの簡単なオブジェクトや有利なカメラアングルが集約を支配してしまうことがあります。バージョン比較用に固定回帰集合を、モデル選択漏れ制御用に隠れ回帰集合を保持します。

言語のグラウンディングには制御された対比が必要です

意味を保持する言い換えをテストし、次に一つの対象、属性、空間的関係、または行動を変える最小限のペアを試します。無関係な表現やもっともらしい気をそらすオブジェクトを加えましょう。理解可能な対象が一つだけ存在するから成功するポリシーは、言語に基づく選択を示していません。

対象が曖昧または利用できない場合に、説明、拒否、または対応なしを引き起こす指示を含めること。ロボットが根拠のない推測に基づいて行動しないかどうかを評価します。語学テストを文化的にも物理的にも解釈可能に保つこと。言語的な新規性だけでは、課題の実現可能性が静かに変わってはいけません。

5段階の再現可能なロボット VLA 評価プロトコル
再現性には構成の同一性、試験の定義、生の結果、不確実性が必要です。出典:Physical AI Lab。

進捗指標は、まばらな成功を診断可能にします

操作をアプローチ、ファーストコンタクト、セキュアグリップ、リフト、輸送、配置などの段階に分けましょう。最も有効な段階、各段階までの時間、進捗が後で元に戻されたかどうかを記録します。連続的な距離はマイルストーンを補完できますが、タスクの意味論に取って代わるべきではありません。

テスト前に合意した失敗分類法を用いてください:誤ったターゲット、ミスドグリップ、衝突、スリップ、ストップポリシー、タイムアウト、コントローラーリミット、知覚損失、評価者介入。モデル版を目からずに曖昧なビデオをレビューしましょう。タスクレベルと失敗レベルの両方のカウントを報告し、改善に仕組みを持ちましょう。

状態最低報告不確実性物理側計量
マッチングタスク成功数と試験二項区間接触と介入
新しいオブジェクト対象ごとの成果層別区間ドロップまたはダメージ
言語シフトテンプレートごとの結果タスク別クラスタ誤った物体運動
ビューシフトポーズと照明層シーン横断の広がりワークスペースの遠征
遅延ストレス遅延分布パーセンタイル区間ステールコマンドトラベル

試行カウントは誤った精度を防いでいます

10回の試験で10回成功したからといって、100%の成功確率を証明するわけではありません。分子、分母、適切な二項信頼区間または信頼できる区間を報告してください。同じ物体や光景を共有する繰り返しの試行では、観測結果がクラスタリングされます。すべての試みが独立しているふりをするのではなく、オブジェクトごとの結果を表示すること。

運用上重要な差を中心にサンプルサイズを計画しましょう。停止ルールや除外裁判は事前に作成しなければなりません。計算極限が小規模サンプルを強制する場合は、結果を予備として記述し、生の結果を保持します。小数点以下が増えても証拠は増えません。

レイテンシーとデータ使用時数はスコアカードに含まれます

カメラ露出タイムスタンプ、状態サンプリング、推論キュー、モデル完了、コマンド変換、アクチュエーター適用などが含まれます。中央値と尾部の遅延、さらに各観測の動作がロボットに到達した時点での年齢を報告します。平均的なモデルスループットは、物理的故障を支配する稀な停滞と共存することがあります。

ROS 2リアルタイム制御ガイドを使って、推論スケジューリングと境界付きハードウェアループを分離してください。制御された遅延やドロップフレームを注入し、ステールコマンドの移動とフォールバックの挙動を測定します。システムは不確実性を露呈させるか、古い計画を静かに実行するのではなく、停止すべきです。

介入と副作用はアウトカムです

緊急停止、保護停止、オペレーターのテイクオーバー、手動のオブジェクトリセット、衝突、落下、力やトルク制限の事象をカウントします。救済された試験は自律的な成功ではありません。最終オブジェクト状態がタスク述語を満たしても、ニアミスやワークスペース違反を報告してください。

接触証拠を ロボットの衝突検知ガイドと連携させろ。能力評価は機能安全を確立しません。保護機能、リスク評価、検証は、ロボットを規定する標準および適用要件の下で、独立したエンジニアリング活動として残ります。

ジェネラリストポリシーの例には主張規律が必要です

Octoプロジェクトは、多数のOpen X-Embodimentデータ上で事前学習され、複数の実際のロボットセットアップで評価されたトランスベースの拡散方針を記述しています。これはクロスエボディメントポリシー作業の有用な例ですが、その結果は報告されたタスク、ロボット、評価手順に特化したものです。

公式のOctoリポジトリには実装とライセンスの詳細が記録されています。このようなモデルを適応させる際には、観察およびアクションアダプターのドキュメント化、データやコントローラの違いの微調整を行いましょう。紙の平均を未検証のロボットに移したり、ジェネラリストの方針を普遍的だと説明したりしないでください。

監査可能な結果パッケージを公開する

タスク定義、設定マニフェスト、試験ごとの成果、シード、タイムスタンプ、評価者ルール、失敗ラベルを公開します。プライバシーと権利が許す範囲で同期したビデオとテレメトリは保持しましょう。集約表は、バージョン付きスクリプトで試験レベルのデータから再現可能であるべきです。

Octoの論文Open X-Embodimentリポジトリは、一つのジェネラリストポリシーエコシステムの主要な文脈を提供しています。正確な修正を引用し、出典の主張を測定値から分けてください。明確な否定的な結果は、説明のつかない成功率よりも価値があります。

  • モデル、プロンプト、ロボット、コントローラーの識別を凍結します。
  • 測定可能なタスクと部分的な進捗を定義してください。
  • Stratifyマッチング、合成、シフトケース。
  • レポート数、不確実性、遅延、データ老化。
  • 介入や身体的副作用を数えましょう。

よくある質問

ロボティクスにおける「VLA」とは何を意味するのでしょうか?

通常、視覚・言語・行動モデルを指し、ロボットの行動を視覚観察と言語に基づいて条件付けます。アーキテクチャやアクションインターフェースは異なるため、ラベルだけでは仕様ではありません。

タスクの成功は、2つのポリシーを比較するのに十分でしょうか?

いいえ。試験数、不確実性、タスク層、進捗、潜伏期間、介入および失敗を含めてください。そうでなければ、同じ割合でも全く異なるシステムを説明できます。

一般化はどのように検証すべきでしょうか?

新しい対象、ポーズ、視点、表現、組み合わせなどのシフトを名付け、各層を訓練のような条件とは別々に報告します。

人間の救助は成功とみなされるべきでしょうか?

いいえ。自律的な結果と介入を別々に記録してください。救済完了は有用な診断証拠となり得ますが、自律的な成功とは限りません。

高い VLA スコアはロボットの安全を証明するのでしょうか?

いいえ。能力ベンチマークは、ハザード分析、保護機能、安全性検証、または用途固有の運用限界に代わるものではありません。

VLA 評価主張境界

VLA 評価結果は、記録されたモデル、ロボット、コントローラー、タスク分配および試験手順に適用されます。未検証環境に一般化したり、安全認証として使用すべきではありません。