人間とビデオフィードバックからのロボット報酬モデル

ロボット報酬モデルは、人間の判断、デモンストレーション、動画の進行状況を状態、行動、または軌跡セグメントのスコアに変換します。手書きの報酬に滑らかさ、配慮、許容可能な回復、指示遵守などの特性が欠けているものの、学習したスコアがフィードバックプロセスの代理として残る場合に有用です。

主なリスクは、レビューされた例以外の最適化です。モデルは保留された比較をうまく予測でき、それでもカメラのショートカット、繰り返し、長い軌道、またはラベルデータ内の好ましいクリップと相関する危険な行動を報いることができます。

このガイドは、 人間介入データガイド および ロボット VLA 評価ガイドと併用してください。タスクの成功、安全性の制約、そして独立した人間の判断は報酬モデルの外に置いておくべきです。

報酬モデルが正確に何を予測しているのかを定義する

出力がペアワイズの好み、スカラーの質、目標の進行状況、成功の可能性、または将来の事象推定を表すかを選択します。そのラベルの背後に観察ウィンドウ、アクションコンテキスト、予測範囲、評価者集団を明記してください。

快適さ、スピード、安全性、タスク完了を一つの非公式スコアにまとめてはいけません。オペレーターが展開ごとに異なる方法で寸法を交換する場合、寸法を別々に保持しましょう。

国際宇宙ステーションでハプティクス-2制御装置を操作する宇宙飛行士トーマス・ペスケ
人間の評価には、動画のみのモデルでは観察できない努力、遅延、接触情報が含まれます。この写真は報酬モデルのパフォーマンスを示していません。出典: ESA/NASA(Wikimedia Commons)利用条件: パブリックドメイン、NASAの作品

質問に合ったフィードバック形式を選ぶ

ペアワイズ比較では、どちらのセグメントが優れているかを問い、評価者間のスケール差を減らすことが多いです。評価は規模を表しますが、アンカーが必要です。進捗ラベルは時間的密度を提供しつつ、タスクが単調に目標に向かって進むと仮定します。

成功ラベルは、より狭いエンドポイントの問いに答えます。運用決定からフォーマットを選択し、引き分け、悪いケースの両方を記録し、結果を判断できず、恣意的な勝者を強制するのを避けましょう。

フィードバック回答強度一次リスク
ペアワイズどちらが望ましいか単純な相対判断絶対的な品質はありません
レーティングなんて素晴らしいことでしょう利用可能なマグニチュードレータースケールドリフト
進展ゴールに近づく高密度時間信号非単調課題
成功目標達成明確な終点まばらで狭い
訂正何を変えるべきか実行可能なコンテキスト教師と制御バイアス

観測可能なラベル付け基準を定義する

タスク目標、禁止される行動、滑らかさまたは効率性の基準、タイ条件、観察不可能な要素を定義します。「良い」「安全」といった言葉に頼るのではなく、対象ロボットからの肯定的・否定的・境界的な例を含めましょう。

ビデオ評価者は、インターフェースがその証拠を暴露しない限り、力、トルク、遅延、カメラ外の衝突、あるいはコントローラーの限界が発動したかどうかを推測できません。見た目を無視するのではなく、欠落している情報に印をつけましょう。

注釈者のアイデンティティと意見の相違を保持する

評価者間の合意をタスクと失敗のクラスで測定しますが、正当な好みの違いを消し去る必要はありません。オペレーター、安全審査員、エンドユーザーは、責任や情報が異なるため、異なる行動を評価することがあります。

評価者トレーニング、評価基準、タイムスタンプ、そして各判断の信頼性を保存してください。体系的な意見の相違を再裁定し、すべてのラベルを多数決にするのではなく、サブグループの行動を報告しましょう。

有用な境界付近のサンプル比較

ランダムなペアは明白で、あまり意味を教えません。アクティブサンプリングは、クローズスコア、ポリシーの意見の相違、新規状態、高影響の失敗を優先し、カバレッジフロアは共通の動作とハードネガティブを保持します。

人間好み強化学習研究は、ペアワイズの軌道セグメントの好みから学習し、評価されたシミュレーション移動およびゲーム設定で結果を報告します。ラベル予算を普遍値として移すのではなく、ターゲットロボットのフィードバックループを再現します。

5段階ロボット報酬モデルの検証
最適化がラベル付き比較分布の外の軌跡を発見する場合、高いペアワイズ精度は報酬ハッキングと共存できます。出典:Physical AI Lab。

軌道とコレクションの文脈による分割

隣接するエピソードのクリップはシーン、オペレーター、オブジェクト、そして結果を共有します。微分がクロストレーニングとテストを行う場合、報酬モデルは学習の行動品質ではなく記録セッションを特定することがあります。

グループは出典エピソード別に分けられ、主張が必要な場合はオブジェクト、サイト、オペレーター、ポリシーバージョンごとに分けられます。親の軌道と重ね合わせたウィンドウは、増強、トリミング、重ね合わせを続けてください。

ビデオ報酬はエンボディメントの制約内で使用する

人間のビデオはロボットの動作なしで時間的な進行や物体関係を教えることができますが、形態、視点、ダイナミクスは異なります。人間の手が物体に近づくことを認識する機能が、ロボットのグリップパーを正しく評価できない場合があります。

HOLD論文は、人間の操作、ビデオ、転送からの学習を評価するシミュレーション実験を研究しています。クロスエボディメント転送を仮説として扱い、ロボット固有の観察、失敗、接触結果を検証します。

制御軌道の長さと報酬集約

フレームごとのスコアを合計することで、長いエピソードや視覚的に満足感のある動きを繰り返すことができる。平均化は一時的な重大な故障を隠し、終末のみのスコアリングは回復の指針をほとんど提供しません。

ポリシー最適化前に割引、セグメント重複、端末処理、故障ペナルティを定義してください。繰り返し、停滞し、進行を逆転させる、または早期終了する合成軌道をテストし、集約の脆弱性を明らかにします。

報酬ハッキングを意図的に探索する

シミュレーションや保護環境でモデルを最適化し、ポリシーの成功だけでなく最も得点の高い軌跡を検証します。カメラアングルを変えたり、オブジェクトを隠したり、動きを繰り返したり、エピソードの境界を突いたりしながら、実際の目的を満たさずに反例を生成しましょう。

ReQueSTの論文は、評価された環境において有益かつ危険な事例を見つけるために、統合された仮定的行動を探求しています。このアプローチは対抗的な問い合わせを動機付けますが、無関係な物理的ロボットの安全性を確立するものではありません。

スコアは宣言された結果に合わせて調整する

ペアワイズ・プリファレンス・ロジットは、必ずしも成功確率とは限りません。操作に閾値が必要な場合は、関連する出力を観察可能な未処理イベントと比較し、ドメインごとに信頼性、ベースレート、不確実性を報告します。

最適化は軌道分布を変えるため、ポリシー変更後に再調整してください。行動ポリシーデータ上で正確なモデルは、新たに作成されたポリシーでは信頼性が低い場合があります。

予測、最適化、そして人を別々に評価する

最初の測定値は比較の精度、ランキング、校正を行った。次に、スコアの最適化がタスクの結果や失敗モードにどのような影響を与えるかを測定します。第三に、独立した評価者に報酬スコアを見ずに結果の軌道を判断してもらう。

タスク成功、安全イベント、介入、時間、エネルギー、サブグループの好みを含めてください。より高い学習報酬で独立した成果が悪い場合は、展開の目的を達成できません。

測定警告反応
レーベル合意率と未知のレートルーブリックの曖昧さガイダンスの改訂
予想保留されたランキングセッションショートカット再分割
最適化スコアと結果の比較報酬ハッキング課題の追加
人々盲目的な判断スコアはこれに反対している代理を拒否する
ロボット成功と安全オフラインのみの獲得展開しないでください

報酬データポリシーバンドルをリリースする

バージョンルーブリック、アノテータープロトコル、フィードバックデータセット、分割、前処理、報酬チェックポイント、集約、キャリブレーション、最適化されたポリシー、チャレンジセット。モデルや人間の意見の相違を引き起こした正確な例を保存してください。

以下のチェックを伴ったクローズリリースレビュー。

  • 判断範囲と予測範囲を挙げてください。
  • つながりや未知、注釈者の意見の相違を保持しましょう。
  • ソースの軌跡と文脈ごとに分けて。
  • 報酬エクスプロイトの最適化されたポリシーに異議を唱えましょう。
  • 報酬、本当の成功、安全、そして盲目的な人間の判断を比較してください。

よくある質問

報酬モデルは成功検出器と同じものなのでしょうか?

いいえ。成功検出器は明確な結果を予測し、報酬モデルは軌跡よりも好み、進歩、質を表すことがあります。

人間のラベルはどれだけあるのだろうか?

普遍的なカウントは存在しません。カバレッジ、合意、学習曲線、ポリシー課題の結果を目標分布に用いてください。

VLMスコアは直接報酬として使えますか?

タスク固有の検証の後にのみ;一般的な視覚言語スコアは、接触、力、タイミング、安全を欠くことがあります。

より良い報酬モデルは安全制約を置き換えるのでしょうか?

いいえ。独立したランタイム制約とリスク管理は依然として必要です。

最速の報酬ハッキング判定は何ですか?

サンドボックスでスコアを最適化し、最高得点の失敗、繰り返し、カメラやエピソード境界の不正利用を検証します。

優先信号と目標整合境界

ロボット報酬モデルは、記録されたフィードバックプロセスの学習された代理モデルです。導入には、最適化によって行動分布が変化した後の独立したタスク、安全性、人間の判断の証拠が必要です。