ヒューマン・イン・ザ・ループの介入データは、行動を監視し、困難または危険な状態の近くで制御を取り、軌道を修正し、制御を取り戻す自律的な展開から得られます。これは、最初から人間が操作するオフラインの遠隔操作デモンストレーションとは異なります。
その価値はポリシーによって誘導された状態や回復の文脈にあります。記録には、乗っ取り前の観察、制御権限、人間の行動、介入理由、引き渡しの決定、そしてその後の自律的な結果が一つの連続したタイムライン上で含まれなければなりません。
このガイドは テレオペレーションデータガイド および ロボット評価ガイドと併用してください。職業安全および機械安全管理は学習ループから独立して管理しましょう。
完全なデモンストレーションとは別の介入
人間のオペレーターが選んだ状態のデモンストレーションサンプル。介入サンプルは、オペレーターが支援が必要と判断する前に保険会社が訪問した状態の状態です。これらの分布は異なる学習問題をサポートし、異なるラベルを持つべきです。
修正の前後に自律的な行動を保持しましょう。それらを取り除くと、イベントは孤立した人間の映像に変わり、乗っ取りの原因やハンドバックが成功したかどうかの証拠を失います。

制御権限をステートマシンとして定義する
有効な状態には、自律、警告、乗っ取り要求、人間制御、ハンドバック要求、自律確認、緊急停止などがあります。ボタンの端だけでは、ロボットがリクエストを受け入れたか、どのコマンドがアクチュエーターに届いたかを示すことはできません。
ポリシーやオペレーター提案だけでなく、裁定の出力とアクチュエーターコマンドをログにまとめてください。ネットワーク損失、デッドマンスイッチ、またはセーフティコントローラが要求されたモードと競合した場合の優先度を定義します。
| フェーズ | 必要記録 | 主な質問 | 故障リスク |
|---|---|---|---|
| 自律的 | ポリシー観察と行動 | 何がトラブルを引き起こしたのか? | 前駆者が欠けている |
| 買収 | 要求時間と有効制御時間 | 権限の移転はどのくらい遅れましたか? | レイテンシ |
| 訂正 | 人間の行動と意図 | どのような回収が試みられたのでしょうか? | 曖昧なラベル |
| ハンドバック | 門と国家の信頼 | 今、ポリシーはうまく機能するのでしょうか? | 即時の再発 |
| 結果 | タスク、安全性、介入結果 | 回復は効果がありましたか? | チェリーピッキング |
介入前の文脈を保持する
数秒間またはタスク関連の期間をバッファしてから引き継ぎ、データセットに前兆の手がかり、ポリシーアクション、進捗損失を含めるようにしましょう。正しいウィンドウは固定されたフレーム数ではなく、タスクのダイナミクスやアクションホライズンに依存します。
同期したビデオ、ロボットの状態、コマンド、フォース、モード、イベントタイムを保存します。人間の判断は、モデル入力に現在含まれていない証拠に依存することがあります。
意思決定とシステムオーバーレイテンシの測定
オペレーターがインターフェース、ネットワーク、仲裁、コントローラーの遅延から判断し判断するための時間が別々に設けられます。物理的なロボットはどちらの間隔でも大きく移動でき、人間が実際に受け取る状態を変えます。
記録リクエスト、確認、初の効果的な人間の指揮、そして測定可能な対応。補正がボタン押下で始まると仮定するのではなく、実際の遅延後の状態を訓練してください。
介入の理由と回復意向の記録
アクションシーケンスだけでは、オペレーターが衝突を防いだのか、アライメントを修正したのか、握力を向上させたのか、不確実性に対応したのかを説明することはほとんどありません。制御された理由の分類法に加え、オプションの注釈や信頼を活用しましょう。
理由はフィルタリングと評価を支持しますが、検証された根本原因とは分けておきましょう。オペレーターの判断はシフトごとに不完全または一貫性がない場合もあります。

すべての行動を真似することなく介入から学ぶ
Siriusプロジェクトは介入信号を用いて、人間がループに関わる展開フレームワークでサンプルの重み付けを行っています。その結果、報告されたタスクとハードウェアを備えた特定の研究方法が生まれ、すべての介入フレームに最大限の重みを置くという一般的なルールではありません。
マッチングデータの下で行動クローン、介入の重み付け、その他の更新情報を比較します。人間の修正は、テレオペレーションインターフェースによって遅延したり、最適でなかったり、制約されたりすることがあります。
オンライン強化学習の範囲を明確に保つ
HIL-SERLプロジェクトは、デモンストレーション、二値報酬分類器、オンライン強化学習、人間の介入を組み合わせています。プロジェクトページには、報告された操作タスクごとにポリシーが改善されるにつれて介入を減らす方法が説明されています。
報酬例、デモンストレーションバッファ、介入、自律的経験を一つのラベルのないデータセットにまとめてはいけません。役割や選択バイアスは異なります。
ポリシー管理可能な状態からのゲートハンドバック
ハンドバックは、ロボットが安定し、衝突がなく、ポリシーが処理可能な状態分布内に収まった後に行うべきです。オペレーターが動きを止めたときに制御を解除することで、未解決の接触や誤ったアライメント時に自律性を取り戻すことができます。
確認応答を要求し、最初の自律的地平線を監視してください。移行履歴を失わずに即時の再買収を許可してください。
通常の行動を消さない介入のサンプル
介入ウィンドウは稀で価値があるため、オーバーサンプリングはよくあることです。過剰な重み付けは、通常状態中の回復動作を模倣したり、ある運用者の習慣を過剰に調整したりすることがあります。
データセット混合ガイドを使って、正常な自律的、成功した回復例、そしてハードネガティブ例を保持しましょう。フェーズごとに効果的な曝露を報告してください。
介入数以上の評価
介入が少なければ、より高い自律性を意味しますが、それだけでなく、より寛容なオペレーター、危険を見逃したり、早期に終了した作業が生まれたりします。自律的な成功、危険な事象、作業量、意思決定遅延、修正期間、再発、タスクの質を報告します。
隠れた支援なしで固定ポリシーの独立評価を実施しましょう。コレクターの安全支援と、ポリシーの測定された自律能力を分離してください。
モードオーバーレイ付きの完結エピソードをレビュー
ビデオ、状態、ポリシー行動、人間の行動、効果的な指揮と権限を同時に再生してください。境界の整合、落下されたパケット、オペレーターが引き継ぎを意図したがロボットが別の理由で停止したケースを点検します。
非介入のエピソードや誤った買収、そして称賛された回収の例を紹介します。オペレーターデータのプライバシーと労働力ガバナンスを維持しましょう。
| メートル法 | 対策 | 必要な分母 | 誤解を招く近道 |
|---|---|---|---|
| 介入率 | オペレーターの業務負荷 | すべての対象となる展開 | 生カウント |
| テイクオーバーレイテンシ | 制御移転 | リクエストイベント | ボタンタイムスタンプのみ |
| 修正の成功 | 即時回復 | 完了した介入 | きれいなクリップ |
| 再発率 | ハンドバック品質 | 自律的帰還 | 最初のセーフフレーム |
| 自律的な成功 | ポリシー機能 | 固定プロトコル試験 | アシスト完成 |
介入データ契約による解放
ドキュメント権限状態、トリガーポリシー、レイテンシ、観測バッファ、アクションチャネル、理由分類、ハンドバックゲート、安全制御、サンプラーおよび評価プロトコル。すべてのトレーニング例を元の継続的な展開にリンクしてください。
以下のチェックリストで検証を締めくくります。
- 乗っ取る前に自律的なコンテキストを記録しましょう。
- 効果的な制御移転と物理的応答を測定します。
- 修正理由、目標、結果を保存してください。
- ポリシー管理可能な状態からのゲートハンドバック。
- 自律性、安全性、学習成果を別々に評価しましょう。
よくある質問
介入データは遠隔操作のデモンストレーションデータと同じですか?
いいえ。これは、人間が方針の修正を判断した状態の自律執行時に収集されます。
介入のわずかな数秒だけを節約できるのでしょうか?
いいえ。前兆、引き継ぎ、修正、返却、そしてその後の結果を一つの同期されたエピソードタイムラインに保持します。
介入回数が減ることは改善を証明するのでしょうか?
いいえ。固定プロトコルの自律性、安全性、ワークロード、ミスイベント指標と組み合わせましょう。
すべての人間の行動を地に足のついた事実として扱うべきでしょうか?
いいえ。人間の修正は遅延したり、インターフェースに制限されたり、最適でない場合があり、文脈に応じたラベルや評価が必要です。
いつ保険にコントロールを戻すべきでしょうか?
明示ゲートがポリシーが管理可能な安定した状態を確認し、ハンドバックが確認された場合にのみ、
制御権限と自律的なハンドバック境界
介入データは、制御権威のトレースであると同時に訓練サンプルでもあります。乗っ取りを引き起こした国家と、自律的なハンドバックが安全だったという証拠を保存する。