ロボット学習データ品質:エピソードの実践的監査

ロボット学習データの質とは、観察、行動、状態、タスクの文脈、結果の一貫性を指します。シャープな映像だけでは不十分です。もしそのアクションが別のタイムスタンプ、フレーム、コントローラーの解釈に属すると、すべての個別フィールドが有効に見えても、そのエピソードは偽りの物理的関係を教えてしまいます。

有用な監査は、自動的な完全性チェック、視覚再生、統計的要約、そして提示されたポリシー証拠を組み合わせたものです。失敗や人間の介入は、その意味が分かっているときに保存しつつ、腐敗や漏洩、未記録の変革を拒否します。数量はこれらのゲートの前に報告されるべきではなく、その後に報告されるべきです。

このガイドは ロボットアクションデータガイド および テレオペレーションデータガイドと併用してください。 Open X-Embodimentリポジトリ は、統一ストレージが依然としてデータセットごとの意味論と引用を必要とする理由を示しています。

質を保存された物理的意味として定義する

因果単位から始めましょう。観察とロボットの状態が行動につながり、それが世界を変え、結果を生み出します。品質チェックでは、この関係が正しく符号化されているかどうかを検証すべきです。ファイルの可読性と画像解像度は必要ですが、条件はかなり弱いです。

意図した学習問題、予測範囲、アクション適用ルールを書きます。10 Hzでデカルトデルタ作用を収集したデータセットは、30 Hzで絶対的な結合目標として扱うことはできません。すべての変換には明示的で検証可能な意味契約が必要です。

フランカロボットアームのエンドエフェクターを手動指導中に物理的に操作する人物
人間主導のデモンストレーションは、信頼できる学習データとなるために、同期したロボットの状態、行動定義、キャリブレーションおよび介入コンテキストが必要です。出典: Wikimedia Commons。ライセンス: CC BY-SA 4.0

エピソードスキーマとフィールド辞書を凍結する

必要なセンサー、タスク指示、ロボットの状態、動作、タイムスタンプ、キャリブレーション参照、コントローラモード、終了原因、介入状態を指定します。型、単位、座標フレーム、有効範囲、欠損値の挙動を定義します。オプションフィールドも存在する場合、同じ定義が必要です。

スキーマを無言で追加したり再利用したりするのではなく、バージョンを調整しましょう。パーサーは未知のクリティカルバージョンを却下すべきです。ソース、ロボット、ソフトウェアの識別子を保存し、将来のキュレーターが意味のある流通シフトと腐敗を区別できるようにしましょう。

フィールドグループ必要な意味自動チェック人間チェック
観察センサーと捕獲時間形状と単調時間目に見える整列
戦闘コマンドの意味論と地平線分布域と寸法再生方向
状態測定されたロボット構成制限と連続性ポーズ・プラルース可能性
結果成功または失敗の原因許可されたラベルセット課題結果
背景キャリブレーションとバージョン参照が存在する正しいハードウェア

同期と動作遅延の測定

センサーキャプチャ、ロボット状態サンプリング、オペレーター入力、コマンド発行、コマンドアプリケーションを1クロックで比較できます。固定オフセット、ジッター、サンプルドロップ、バッファリングの推定。配列インデックスを一致させることだけでは、イベントが同時に起こった証拠ではありません。

グリッパーポーズ、アクションベクトル、接触イベントのオーバーレイでシーケンスを再生します。急な変化は予想通りの順序で現れるべきです。残留時間の不確実性を定量化し、ロボットの速度やポリシーの展望に対して許容できるかどうかを判断してください。

行動座標系、単位、規約を明確にする

作用は関節位置、速度、トルク、デカルトポーズ、デルタ、ツイスト、またはグリッパー状態のいずれかです。値が絶対値か相対値か、どのフレームが使われるか、向きの表現方法、コマンドがカバーする区間、そして制限が適用される場所を明記します。

元の単位を保持してから正規化し、変換します。既知の動作をテストしてください:プラスx、片関節回転、グリッパーの閉じは予測可能な兆候を示すはずです。7次元ベクトルが一致することを仮定したデータセットマージは、互換性のない物理コマンドを組み合わせることができます。

5段階ロボット学習データ品質ゲート
品質のゲートは、価値ある失敗の証拠を削除せずに、歪んだ意味を拒否すべきです。出典:Physical AI Lab。

トラックキャリブレーションとハードウェア構成

カメラの内蔵、ハンドアイ変換、ジョイントゼロ、ツールセンターポイント、グリッパージオメトリ、ペイロードは収集中に変化することがあります。エピソードとともにキャリブレーションIDや妥当性間隔を保存します。再キャリブレーションが成功するなら、出所が記録されていない古いデータを書き換えるべきではありません。

衝突、再取り付け、工具交換後に収集されたセッションを検出します。セッションごとに予測されたジオメトリやタスクランドマークを比較しましょう。変換が不確実な場合は、見た目はきれいだが幾何学的に一貫性のないサンプルを配布するのではなく、影響を受けた範囲を隔離してください。

変化リスクのあるデータ保持すべき証拠監査対応
カメラの再マウント画像とロボットポーズ外在的前後スプリット有効性範囲
工具交換行動と接触TCPとペイロードID別編成
合同勤務状態と運動学ゼロキャリブレーション動議の再検証
コントローラーのアップデート応用行動ファームウェアとモードバージョンの挙動
クロックソースの変化全アライメントオフセットおよびドリフトテストタイミングの再推定

段階別にラベルの失敗を決める、最終的な成功だけでなく

二項成功ラベルは、認識の失敗、握りの滑り、計画のタイムアウト、衝突回復の発動、位置の誤りなどを隠します。一次故障段階、終了理由、そしてエピソードが物理的に安全であったかどうかを明確にした簡潔な分類体系を用いましょう。

難しく失敗したエピソードは、ラベルや信号が信頼できるときに保管しましょう。すべての失敗を除去すると理想状態の分布だけを学び、回復行動を隠します。意味不明のエピソードを削除または隔離し、単に失敗したエピソードではなく。

人間の介入を監督として扱う

テレオペレーションの引き継ぎ、修正の促し、緊急停止、手動リセットは、自律性が失われた状態を明らかにします。介入を開始した人物や内容、開始と終了、前のポリシー文脈、乗っ取り後の行動源を記録してください。

自律的な行動と人間の行動をソースフラグなしで混ぜ込まないでください。学習者は、回復としてしか意味のない突然の命令を真似してしまうことがあります。介入率や介入までの期間も、次の収集サイクルを指針とする展開指標となります。

制御混合重みとドメインカバレッジ

データセットのサイズは、ロボット、タスク、オブジェクト、シーン、オペレーター、成功状態、ハードウェアバージョンごとに分けるべきです。ゆっくりとしたエピソードからほぼ同じフレームが何百万もあっても、広範な体験とは言えません。エピソード、期間、効果的な多様性をまとめて報告しましょう。

デプロイ目標から混合重みを設定し、どのドメインがバッチを支配しているかを確認します。たとえ主要な成功率を下げても、安全に関連した稀なケースや回復ケースを保存すること。重み付けの決定はトレーニングランに合わせて調整すべきです。

重複と評価漏れの検出

連続セッションをサンプルレベルで分割すると、ほぼ重複したフレームがランダムなトレインとテストの分割をクロスすることがあります。一般化主張に従い、シーン、オブジェクトインスタンス、軌道、時間ブロック、または収集キャンペーンごとに分割されます。ハッシュは正確なコピーをキャッチします。埋め込みやメタデータは、ほぼ重複するものを見つけるのに役立ちます。

検証とテストは可能な限り反復的なキュレーションの外に行ってください。テストセットがフィルタリング、ハイパーパラメータ、プロンプト設計に影響を与える場合、それはもはや未加工の推定値ではありません。新しいホールドアウトスライスを作成し、変更を記録しましょう。

自動ゲートとビジュアルレビューを組み合わせる

自動チェックはスキーマ、範囲、単調タイムスタンプ、サンプルギャップ、キャリブレーション参照、アクション連続性、画像デコード、重複率、ラベル有効性をカバーすべきです。セッションごとに失敗を階層化し、システム的なキャプチャバグが孤立ノイズと間違われないようにしましょう。

人間のレビュアーは同期されたマルチビュー再生、アクションオーバーレイ、接続および終了を点検すべきです。ランダムエピソードと自動アウトライヤークラスを含むサンプリングプランを使いましょう。目に見えない削除ではなく、レビューの決定やレビュー担当者の合意を記録しましょう。

生エピソードからトレーニングバッチまでのバージョン系譜

不変の生データを保持し、再サンプリング、キャリブレーション適用、フィルタリング、再ラベリング、チャンク化、正規化のための再現可能な変換を作成します。各派生シャードは入力バージョン、コード改訂、パラメータおよび出力チェックサムを識別する必要があります。

Open X-Embodimentの論文OpenVLAの論文は有用な一次技術的参考文献ですが、それらの結果は新しい私的混合物を検証するものではありません。ロボットのデータファクトリーガイドとホールドアウトのハードウェアテストでループを締めくくりましょう。

  • スキーマ、ユニット、座標フレームをフリーズします。
  • キャプチャからアクションまでのタイミングとジッターを測定してください。
  • キャリブレーション、ハードウェア、コントローラーのバージョンは保持してください。
  • ラベル付けされた失敗や介入を保存しましょう。
  • 漏れを防ぎ、変身ごとにバージョンを行ってください。

よくある質問

クリアな映像はロボットのデータ品質と呼べるほど十分でしょうか?

いいえ。観測はロボットの状態、動作、タイミング、較正、結果と一致しなければなりません。視覚的な品質だけでは物理的な意味を保つことはできません。

失敗したエピソードは削除すべきでしょうか?

彼らの信号や失敗のラベルが信頼できるなら、なおさらです。故障と回復は貴重な監督となり得ます。破損または曖昧なエピソードは隔離されるべきです。

異なるロボットのデータを直接統合することは可能でしょうか?

具現化、行動、状態、単位、フレーム、タイミング、タスクセマンティクスが明示的にマッピングされた後にのみ対応します。共有ファイル形式が意味を同一にするわけではありません。

どの程度のタイムスタンプ誤差が許容されるのでしょうか?

動作速度、制御率、センサー露出、ポリシー期間によります。その結果得られる空間誤差や行動誤差を推定し、タスク固有の限界を設定します。

品質審査は完全に自動化可能でしょうか?

自動化されたゲートはスケール性が良いですが、同期再生やタスク判断は意味誤りを検出し、範囲やハッシュが見逃すのも見逃せません。録音された決定との両方を使いましょう。

ロボットデータセットの証拠境界

ロボットデータセットの品質は、学習目的、身体化、行動意味論、展開領域に特化しています。データセットのスケールや統一フォーマットは、系譜やハードウェア検証の代わりにはなりません。