ロボット評価のデータ漏洩:場所・物体・作業者がテストに混ざる問題

ロボット評価の漏れは、訓練やモデル選択が意図されたテスト分布から情報を得たときに発生します。一般的な漏洩では、入力に明示的な正解ラベルは現れません。代わりにエピソード、セッション、オブジェクト、オペレーター、サイト、または派生メディア間で共有されたコレクションコンテキストです。

配属主張に従って正しい分割部隊が選ばれます。同じセッション内の新しいフレーム用に設計されたモデルは、新しいオブジェクト、演算子、サイト、または実体用に意図されたテストとは異なるテストが必要です。ランダムなフレーム分割は、より広範な主張を支持することはほとんどありません。

このガイドは ロボット評価ガイド および データセット系譜ガイドと併用してください。プロトコル承認後はメンバーシップとアクセスを凍結してください。

比率を決める前に一般化の主張を定義する

モデルが新しい時間、エピソード、オブジェクトインスタンス、カテゴリ、オペレーター、サイト、ロボット、またはタスクを処理しなければならないかどうかを明示します。抵抗グループもその声明に従います。普遍的な80/10/10の比率は独立性を生み出しません。

デプロイメントが複数の質問をした場合に複数のテストを作成しましょう。便利なテストセットだけでは、すべての一般化軸を切り離すことはできません。

NISTのロボット試験施設内の機器について研究者が説明しています
ロボット評価は、モデルだけでなく、現場、機器、対象物、運用手順も反映されます。写真には分割方法が示されていません。出典: NIST / A. ユースティス(Wikimedia Commons)利用条件: パブリックドメイン、米国政府の作品

最も低い独立収集ユニットで分割

エピソード内のフレームは背景、オブジェクト状態、演算子、時間的隣接者を共有します。セッション内のエピソードでは、照明、キャリブレーション、ツールの摩耗、スクリプト化されたセットアップを共有することがあります。依存するグループをまとめておく。

不変のグループIDを使用し、パイプライン内で不整合性を強制します。名前が変更されたファイル名から後からグループを再構築するのは避けましょう。

主張最小ホールドアウトグループ漏れの例報告された検査
新しい時点時間的ブロック隣接フレーム今後のセグメント
新エピソードエピソードロールアウトウィンドウは同じですエピソードの保留
新しい対象物理インスタンス一つの物体の異なる視点インスタンスホールドアウト
新しいオペレーターオペレーターまたは回収チーム遠隔操作の習慣オペレーターのホールドアウト
新サイト施設とセットアップ背景と試合サイトホールドアウト

セッションコンテキストを学習可能なデータとして扱う

モデルは固定カメラポーズ、照明、テーブルマーク、器具の摩耗、初期化ルーチン、ソフトウェアタイミングなどを活用できます。同じ変更なしの日の収集でも、ほとんどのショートカットが共通することがあります。

セッション識別信号のメタデータや画像の監査。主張に新しい環境が必要な場合、現場全体や手続きを延期してください。

実物の対象物インスタンスをまとめて管理します

同じ物体の異なる画像、向き、試行は新しいインスタンスの一般化の独立した証拠にはなりません。傷やテクスチャ、ジオメトリでインスタンスを識別できます。

ポーズやグラップ評価のために、クロップや注釈を不変オブジェクトIDにリンクさせます。 6Dオブジェクトポーズガイド では、インスタンス目標とカテゴリ目標が異なる理由を説明しています。

ホールドアウトオペレーターと指示文スタイル

オペレーターは特徴的な軌道、回収習慣、カメラの構図、言語指示を作成します。ランダムなエピソード分割は、同じ人物をトレーニングとテストに置き、見かけ上の人間一般化のパフォーマンスを膨らませることがあります。

オペレーターごとにグループ化されたテストを使い、経験レベルを報告しましょう。監査に必要なグループ情報を削除するのではなく、管理された識別子でプライバシーを守りましょう。

5段階ロボット評価データ漏洩監査
繰り返しのテストコンサルテーションは、勾配トレーニングにテストフレームが入っていなくても選択バイアスを生じさせます。出典:Physical AI Lab。

拡張データと派生サンプルを追跡する

トリミング、リサイズ、再エンコード、または色増強は異なるファイルハッシュを持ちますが、同じソースフレームの兄弟フレームのままです。ソースの系譜を保持し、派生を生成する前に分割してください。

知覚の類似性を使って欠けている関係を見つけ、マニフェストで確認しましょう。ほぼ重複検出器は、出所を置き換えるのではなく補完的なものです。

トレーニングデータのみに前処理を適用します

正規化統計、語彙、トークナイザー適応、クラス重み、特徴選択、補欠は、グローバルに計算されるとテスト情報を漏らすことがあります。学習済みの前処理成果物はトレーニングの一部として扱いましょう。

トレーニングメンバーが制作に使ったバージョン。フリーズ変換を検証に適用し、再調整せずにテストします。

コントロール検証および試験協議

検証性能からモデルやハイパーパラメータを繰り返し選択することで、開発はそのセットに適応します。テスト結果を見てシステムを修正することで、テストは別の検証源に変換されます。

最終凍結テストを維持し、アクセス制限と評価記録をつけること。繰り返しの反復の後、新しい将来のデータや外部データを主要な意思決定に活用しましょう。

メタデータやコンテンツとの監査の重複

正確なID、親エピソード、セッション、オブジェクト、オペレーター、サイト、ロボット、タスクの交差点を確認してください。次に、視覚的、時間的、軌跡的な類似性を用いて誤ったラベル付けやコピーされた兄弟姉妹を見抜きます。

DROIDデータセットプロジェクトは、サイトや運営者をまたぐ大規模な野生コレクションを示しています。データセットの規模や多様性は、主張に特化したグループ分割の必要性を排除するものではありません。

レポートグループ数と不確実性

フレーム数は膨大ですが、独立したオブジェクトやサイトは少ないことがあります。分割単位でのサンプル、グループごとの成功・失敗、信頼区間、除外された試験を報告してください。

1つのサイトやオペレーターで高い平均をつけても、広範な一般化は成立しません。状態レベルの結果と下部尾の行動を示します。

テストマニフェストを凍結し、バージョンを保存する

不変のメンバーシップ、グループ化ルール、前処理のアイデンティティ、評価コード、アクセス履歴を保存します。新しい入力データは自動的にリバランスや過去のテストサンプルを置き換えるべきではありません。

展開主張が変更されたら、新しいバージョンを作成し、古いバージョンとの比較可能性を保持してください。メタデータの欠落やラベルレビューの品質 監査 に接続してください。

漏水監査方法合格条件残留リスク
アイデンティティ正確なマニフェスト結合クロススプリットのソースIDはありませんIDの紛失
グルーピングエピソード、セッション、オブジェクト、オペレーター、サイト禁止されたグループ重複はありません誤ったグループ化ルール
派生親系譜兄弟姉妹は共に暮らしています失われた親
類似点視覚的および軌道探索ほぼ重複したレビュー偽のマッチ
アクセス評価ログプロトコル限定診察未記録のコピー

分割承認チェックリスト付きのリリース

展開主張、グループ階層、メンバーシップマニフェスト、派生系譜、列車のみの前処理、重複監査、サンプルカウント、不確実性、アクセスおよび更新ポリシーの文書化。試験は定期的な研修業務には使わないようにしましょう。

以下のチェックリストで検証を締めくくります。

  • デプロイメント主張からホールドアウトグループを選択します。
  • 依存するエピソードやセッションを1つのパーティションにまとめて管理しましょう。
  • オブジェクト、演算子、サイト、派生兄弟姉妹を追跡します。
  • 学習した前処理成果物はすべて列車に収めてください。
  • 会員数、アクセス数、評価数を凍結。

よくある質問

ロボットデータにはどのくらいの列車と検証試験の比率が使われるべきでしょうか?

まずはグループ独立性と十分な評価力を選択し、固定比率で漏れを解決することはできません。

異なる採集日は新しいテスト環境になるのでしょうか?

サイト、オブジェクト、キャリブレーション、オペレーター、手順が共有されている場合、必ずしもそうとは限りません。

ユニークなファイルハッシュは重複がないことを証明しますか?

いいえ。作物、再エンコード、増強は同じソースを共有しながら新しいハッシュを持ちます。

なぜテスト性能によるチューニングが漏れるのでしょうか?

開発プロセスはどの選択肢がテストで良い結果を出すかを学習するため、もはや未加工の一般化を推定しなくなります。

一つのテストセットであらゆる一般化を測定できるのでしょうか?

いいえ。必要に応じて、新しいエピソード、オブジェクト、オペレーター、サイト、ロボット、タスクごとに別々のグループテストを使用してください。

展開非依存テストおよび凍結アクセス境界

評価の独立性は、ランダムな割合ではなく、デプロイ主張によって定義されます。モデル選択開始前に、グループ化されたメンバーシップ、派生系譜、テストアクセスを凍結してください。