ロボット視覚データ増強およびアクションラベル

ロボット視覚データ拡張は観察を変化させ、トレーニングは関連する行動を監督として保持します。明るさやセンサーノイズの変化はアクションの意味を保持できますが、トリミング、ひっくり返し、回転、合成視点などが幾何学や視界、座標慣習を変え、元のコマンドを誤ってしまうことがあります。

したがって、受け入れの問題は拡張画像がリアルに見えるかどうかではありません。観測行動記録全体が、宣言されたカメラモデル、コントローラーフレーム、予測地平線の下で物理的に一貫したロボット状態を記述できるかどうかです。

このガイドは ロボットアクションデータガイド および アクション正規化ガイドと併用してください。トレーニングデータに拡張ポリシーを適用し、クリーンな展開結果とストレステスト結果を別々に報告します。

増強をレコード変換として扱う

トレーニングの例には、同期画像、固有受容感覚、言語、動作、カメラキャリブレーション、タイムスタンプ、マスクなどが含まれます。拡張パイプラインは、どのフィールドを変更し、どのフィールドが不変であり、どれが無効になるかを宣言しなければなりません。ピクセルの更新だけが安全で、狭く正当化されたフォトメトリック変換の場合のみです。

変換ファミリー、サンプリングパラメータ、ランダムなシードまたはリプレイレコードを保存します。この証拠により、誤ったラベル付けされた例も再現可能となり、レビュアーは元の観察と失敗を比較できるようになります。

NASAのFIDOローバーがパノラマカメラマストとロボットアームをテストサイトで展開
ロボットの観測は物理的なカメラ、視点、アクチュエーターフレームに結びついています。写真には増幅方法の描写はありません。出典: NASA/JPL(Wikimedia Commons)利用条件: パブリックドメイン、NASAの作品

光度変化と幾何変化の別個

明るさ、コントラスト、色温度、ぼやけ、ノイズは主に見た目を変えますが、攻撃的な値は課題の証拠を消し去ることがあります。トリミング、リサイズ、回転、反転、パースペクティブワープは画像のジオメトリを変え、レイやキーポイント、ロボットフレームターゲットに対してピクセルを移動させることができます。

実装前に各変換を分類し、妥当性区間を定義します。倉庫カメラは照明の変動は許容できますが、グリッパーや接触面が取り除かれるクロップには耐性があります。

トランスフォーム通常は変わるラベル義務主な故障
カラーまたは露出外見行動は検証済み範囲内のみにとどめてくださいタスクキューが消去されました
ぼかすかノイズかセンサー品質時間と可視性ラベルを保持する非現実的な腐敗
トリミングまたはサイズ変更視野と内在要素内在的ラベルと空間ラベルの更新ターゲットが削除された
フリップまたはローテーション向きと利き手変換ポーズとアクションの慣習ミラー命令
ビュー・シンセシスカメラ光線と遮蔽ジオメトリと可視性の再計算一貫性のないシーン

トリミングとリサイズ後にカメラの内部要素を更新

作物は主焦点をずらし、サイズ変更は焦点距離と主焦点をスケールさせます。ピクセルのみを消費するモデルでも、示された動作が元のビューから生成されたものの、新しいビューではオブジェクトがずれているように見える場合、矛盾したマッピングを学習できます。

内在的要素、深度、光線が入力の場合は、それらを明示的に変換します。必要なカメラメタデータが欠けているサンプルは、元のキャリブレーションを静かに再利用するのではなく、却下してください。

フリップや回転による変形ポーズと動作

水平反転はロボットにとって自動的にラベル保存になるわけではありません。左右の関節、署名のあるヨー、工具の向き、手の識別子、ワールドフレームの平行移動はすべて定義された変換を必要とする場合があります。視覚的にもっともらしい鏡は、誤った方向に動きを指示することができます。

各作用成分に対して代数的に写像を書き、往復をテストします。具現化やタスクに有効な対称性がない場合は、ミラーラベルを発明するのではなく変換を無効にしてください。

シーケンス間の時間的整合性を保持する

ポリシーはしばしばフレームスタック、アクションチャンク、ビデオウィンドウから学習します。各フレームごとに異なるクロップや色の変化をサンプリングすることで、展開時には発生しない人工的なカメラの動き、ちらつき、速度の手がかりを生み出すことができます。

時間的破損が宣言されていない限り、各幾何学的パラメータを1回ずつサンプリングします。タイムスタンプ、オプティカルフロー、トラッキングラベル、可視マスクを一貫して適用してください。

5段階ロボット視覚拡張検証
トリミング、フリップ、ビュー変換は、物理的に不可能なアクションラベルと組み合わせたもっともらしい画像を作成できます。出典:Physical AI Lab。

行動の可視性と接触証拠の保護

クロップは、示された動作を説明するグリッパー、道具、物体、接触点、障害物を取り除くことができます。閉塞増強は有用ですが、その証拠がなくても安全に機能することが期待され、ラベルが望ましい反応を表している場合に限られます。

保持目標領域、キーポイントの可視性、接触領域カバレッジを測定します。重度の閉塞を元の行動を続ける際に判断保留や観察品質のラベルに割り当てるのは正当化されません。

バウンドカラー、ぼかし、センサーノイズ範囲

光度増強は、視覚的多様性を最大化するのではなく、サポートカメラや動作条件を近似するべきです。適合度は展開キャプチャ、センサー仕様、または記録された応力範囲など多岐にわたります。小さな特徴に影響を与える際の飽和度、ガンマ線、ビット深度の挙動を保持します。

DrQの研究は、評価された環境においてピクセルベースの強化学習による画像拡張の効果を報告しています。すべての歪みやロボットのタスクが利益をもたらすとは限りませんので、ターゲット観測スタックに証拠を再現してください。

トレーニング、検証、テストのパイプラインを区別する

確率的訓練の拡張は堅牢性を向上させることができますが、それを展開に似たメインのテストに適用すると問題が変わります。未操作のテストセットと、固定シードと厳しさレベルの別名の摂動スイートでパフォーマンスを報告してください。

フィット範囲、正規化、学習した補強方針はトレーニングデータのみに適用されます。評価の分割は、変換確率や重症度の調整時に下される決定に依存していなければなりません。

幾何学的な整合性と複数視点の統合を用いる

合成視点は、シーン表現、カメラポーズ、閉塞の推論が十分に強力で、タスク関連のジオメトリを保持する必要があります。幻覚的な物体の端や衝突の欠落は、不可能な観察と変わらない動作を結びつけることがあります。

DexPilotシステムを含むドメインランダム化研究は、普遍的なレシピではなくタスク特有の証拠を提供します。各レンダラー、アセットセット、カメラの分布を実際のシーンと照らして検証してください。

増強によって導入された監査分配シフト

変換は一つのギャップを減らしながら別のギャップを作ることができます。過剰なぼかしは、細かい接触の手がかりを無視することを教えることもあります。攻撃的なクロップはターゲットを画像中心に偏らせることがあります。色相シフトは、課題で正当に用いられる色の区別を取り除くことがあります。

増強前後の特徴統計、アクション条件付きカバレッジ、故障クラスターを比較してください。マッチドトレーニング計算の下で、非増強および1回の変換によるアブレーションを含めてください。

復号されたロボットの結果を測定する

ピクセルの損失や検証アクションエラーは、物理的に重要な効果を隠すことがあります。予測をジョイント、エンドエフェクタ、またはモバイルベース単位にデコードし、飽和、符号誤差、衝突マージン、変換の重度に伴うタスク関連変位を測定します。

RAD研究DROIDプロジェクトは、研究およびデータセットの文脈を示しています。デプロイメントは依然として独自のコントローラーレートリプレイとハードウェア受容テストが必要です。

監査層測定警告判決
画像視認性とクリッピング証拠は削除されました削減するか拒否するか
幾何学内在性とポーズ残差古いキャリブレーションリラベル
順序変換整合性人工的なちらつき共有パラメータ
戦闘復号物理誤差間違った標識や枠フィックスマッピング
ハードウェア成功と安全圏オフラインのみの獲得離さないでください

拡張契約をリリースする

バージョン変換コード、確率、パラメータ範囲、カメラ慣例、ラベルマッピング、時間的範囲、列車のみ統計、データセットとチェックポイントを用いた評価スイート。増強によって効果的な監督が変わった場合、モデルはその重みから再現できません。

レビューの最後に以下のチェックをしてください。

  • すべての変換に対して不変量を宣言します。
  • ジオメトリ、ポーズ、アクションラベルを一緒に更新しましょう。
  • 一貫した時間の窓を保持しましょう。
  • クリーンなデプロイのようなテストセットを保ちましょう。
  • 解読されたアクションやストレスケースをリリース前に再プレイしましょう。

よくある質問

ロボット画像に水平フリップを使ってもいいですか?

実装、タスク、座標系、アクションラベルが正確に検証された対称性写像を持っている場合にのみ成立します。

検証データにも拡張を適用すべきでしょうか?

一次検証とテストセットをクリーンに保ち、摂動には固定され、別途報告されたストレススイートを用いましょう。

トリミングには新しいカメラの内蔵部品が必要ですか?

はい、ジオメトリやレイを使う場合、そしてアクションとラベルの関係も物理的に一貫していなければなりません。

強化は常により強力なのでしょうか?

いいえ。過度な歪みは因果的タスクの証拠を消去したり、展開から遠い合成分布を生み出したりします。

最低限のハードウェアチェックはどれくらいですか?

デコードされたコマンドを代表変換で再生し、タスクの結果、誤差、飽和度、安全余裕を測定します。

観察-行動整合性境界

ロボット視覚拡張は、観察、カメラの幾何学、動作の意味、時間的文脈が一貫している場合にのみ有効です。視覚的リアリズムだけでは正しい訓練ラベルの証拠にはなりません。