クロス・エボディメントロボットアクション正規化

クロスエボディメントアクション正規化は、異なる関節、ツール、コントローラーを持つロボットのコマンドを、共有ポリシーが学習可能な表現にマッピングします。目的は意味的な整合であり、単にすべてのベクトルを同じ長さにパディングするのではありません。

7次元エンドエフェクタアクションは、フレーム、回転慣習、絶対意味またはデルタ意味、制御期間、グリッパーの意味論において依然として異なる場合があります。各ロボットへの逆マッピングは、リーチ、ジョイント制限、コントローラーの種類、安全範囲を尊重しなければなりません。

このガイドをロボット アクションデータガイド および ロボットデータ品質監査と組み合わせてご利用ください。ネイティブアクションと可逆変換を保持し、失敗を物理コマンドに遡ることができます。

ベクトル長の前に意味を正規化する

コマンドタイプ、制御フレーム、ユニット、回転慣例、参照状態、時間間隔、制限、欠損次元のスキーマから始めます。同じ形状の2つの配列は、一方が結合位置でもう一方がデカルト速度である場合、互換ではありません。

各データセットにはネイティブのフィールド名とドキュメントを必ず残してください。共通テンソルは導出されたビューであり、元のロボット契約の代替ではありません。

二重アームと高度なグリッパーハードウェアを備えた2台のPR2ロボットが見えます
同じクローズグリップコマンドでも、エンドエフェクター間で異なる変位や力が生じることがあります。写真はロボットと手のハードウェアを写しており、正規化性能は示していません。出典: オレグ・アレクサンドロフ(Wikimedia Commons)ライセンス: CC BY-SA 3.0

共通の動作表現を意図的に選ぶ

デカルト的なエンドエフェクタの平行移動、回転、グリッパーコマンドは、関節の違いを抽象化するため一般的です。すべてのモバイルベース、多指手、両手操作、フォースコントロールモードを捉えているわけではありません。

拡張と妥当性マスクを定義し、サポートされていない次元が同等だと装うのではなく、ポリシーアーキテクチャでは、一つの普遍空間が本質的な制御意味を失った場合、具現化トークンやロボット固有のアクションヘッドが必要になることがあります。

先住民の行動一般的なマッピングオプション必要なメタデータ主な損失リスク
共同ポジションツールポーズへの前方運動学ロボットモデルと関節冗長性
デカルトデルタ共通フレームデルタフレームと回転のルール参照ミスマッチ
速度宣言区間のデルタ制御期間タイムスケーリング
バイナリグリッパー正規化された開閉状態工具の方向と制限力の意味
多指手潜在的またはロボット特有の頭部フィンガースキーマとシナジー器用さの崩壊

絶対、デルタ、速度の各コマンドを別々に

絶対姿勢はターゲットを指定し、デルタは基準からの変化、速度は時間ごとの変化を示します。同じ小さな数でも、各インターフェースで意味や誤りの挙動が異なります。すべてのカードをアクションとラベル付けしタイプなしですると、静かなスケーリング失敗が発生します。

明示的な状態と時間間隔で変換します。どの観測値がデルタ基準を定義し、回転が局所座標か世界座標かを格納します。

座標系と回転規則を保持する

原点、軸方向、利き手、そして平行移動がベース、ワールド、ツール、カメラフレームのいずれかで表現されているかを記録します。回転の場合、四元数の順序、軸角の慣例、オイラー列および合成順序を保持します。

符号付きユニットテストを実行します:正のx、y、zと正の回転は宣言された物理方向にすべてのロボットを動かします。数値分布チェックだけでは鏡像軸や置換軸を見逃すことがあります。

各ロボットスタックを通じて共通の行動表現を反転させます

ターゲットロボットには逆運動学、リミット、衝突判定、そして共通動作を実行可能なコマンドに変換するコントローラインターフェースが必要です。同じデカルトδでも、異なる関節運動を必要とし、ある身体では到達できない場合があります。

展開で使われた正確なコントローラーで逆マッピングを検証してください。正規化後のクリッピングは方向やタイミングが変わることがあり、正当なコマンドを返す代わりに彩度や非現実性を露出させてしまいます。

5段階のクロス身体的動作正規化検証
ターゲットコントローラーがタイミングやグリッパーのコマンドを異なる解釈をすると、正しいアレイの往復トリップは安全でないことがあります。出典:Physical AI Lab。

各工具ごとのグリッパーの意味を定義する

グリッパーは指幅、モーター位置、力、速度、または二進状態を受け入れることができ、ドライバー間で開閉方向が逆になります。複数指の手は、一つのスカラーでは保持できない相乗効果や接触モードを加えます。

物理的な距離、単位、方向、中立的な行動、そしてコマンドが位置か努力かを保存します。逆マッピング後の空の動き、物体接触、失速、リリースをテストします。

欠如次元に対して妥当性マスクを搭載

欠損した底面や指の次元をゼロでパディングすると、不存在と命令されたゼロを区別できません。モデルはパディングからデータセットの同一性を学習したり、明確な拒否経路なしでサポートされていない動きを出力したりすることができます。

マスクとエンボディメントのメタデータを使い、損失とポリシーの責任者が無効なフィールドをどのように扱うかを定義します。マスクなしの共通ベクターをハードウェアに直接送るのは絶対に避けてください。

データセット固有の正規化統計を保持する

平均、標準偏差、最小最大値、またはパーセンタイルのスケーリングは異なるデータセットを数値的に比較可能にしますが、グローバル統計では大規模なデータセットがロボット固有の範囲を支配し隠してしまう可能性があります。統計は評価分割間で計算されると情報が漏れることもあります。

特徴、データセット、実装、分割によるバージョン統計。物理ユニットを回復可能にし、非正規化後に監査飽和状態を保ちましょう。

調整制御速度とアクションホライズン

同じ数値の20 Hzと100 Hzの差は、物理速度が異なることを意味します。アクションチャンクはさらに、その持続時間がレートや実行方針に依存します。リサンプリングはサンプル数だけでなく、時間、つまり時間も保存しなければなりません。

ロボットアクションチャンクガイドを使ってチャンクの実行と再計画を定義してください。サンプル周期、レイテンシ、コントローラがコマンドを補間、保留、キューするかを記録します。

出所を消さずにクロスエボディメントデータセットから学べる

Open X-Embodimentプロジェクトは、多くのロボットやタスクからデータを集約し、クロスエボディメントトレーニングの重要な証拠を提供します。同論文は、データセット固有の変換を保持しつつ、共有アクション空間アプローチを説明しています。

オクトプロジェクトもまた、ジェネラリストポリシーの例です。報告された成果をデータセットや評価の証拠として扱い、ロボット、タスク、ソースの貢献を自分の混合で可視化しておく。

アレイやハードウェアでの往復テスト

まずネイティブアクションを共通空間にマッピングし、その後、タイプ、方向、大きさ、フレーム、彩度を比較します。次に、シミュレーションや拘束されたロボットで境界コマンドを再生し、測定された動き、グリッパーの挙動、タイミングを確認します。

ロボットごとの分布とタスク成果を調査してください。平均的なトレーニングロスは、一台のロボットが常にヨーを切り替えたり、リーチを飽和させたり、グリッパーを後ろに閉じたりしている限り、健康的に見えることもあります。

テスト入力合格条件故障の暴露
スキーマネイティブメタデータ完全なタイプ、単位、フレーム、レート曖昧な行動
数値往復署名済みベースコマンド有界再構成誤差スケール誤差または軸誤差
極限試験境界近くの行動明示的な彩度とマスクサイレントクリッピング
タイミングテストレートとチャンクのバリエーション等価物理的持続時間速度の不一致
ハードウェアリプレイ安全有界列期待される物理的運動コントローラの意味誤り

正規化契約によるリリース

ネイティブスキーマ、共通表現、フレーム変換、回転数学、統計、マスク、コントローラの逆写像、レート、極限、バージョン付きテストを文書化します。ライセンスや保存が許す限り、正規化されたデータと元の動作を保存しましょう。

以下のチェックリストで検証を締めくくります。

  • 動作の種類、フレーム、単位、時間の意味をラベル付けします。
  • ネイティブコマンドと可逆変換を保持してください。
  • 説明のつかないゼロではなく、次元を隠す。
  • データセット、ロボット、分割によるバージョン統計。
  • 署名された往復旅行と制限されたハードウェアの実行を確認しましょう。

よくある質問

すべての動作を7次元にすることは正規化を終えるのでしょうか?

いいえ。フレーム、回転、コマンドタイプ、タイミング、リミット、グリップの意味は依然として異なる場合があります。

結合作用とデカルト作用は1つのモデルを訓練できますか?

確かに、明示的な変形やロボット特有の頭部はありますが、その意味や欠落した情報は目に見えるままでなければなりません。

統計はすべてのロボットに対して一度だけ計算すべきでしょうか?

自動的には。データセットごとロボットごとの統計を保持し、評価の漏れや大規模な情報源による支配を防ぎます。

未使用の次元は単にゼロになり得るのでしょうか?

ただし、付随する妥当性マスクと、命令ゼロの不在と命令ゼロを区別するモデル挙動が伴います。

最も速い信頼できるチェック方法は何でしょうか?

符号付き基底作用を共通変換と逆変換に通し、物理的な方向、大きさ、タイミング、グリッパー挙動を安全に検証します。

共通動作およびロボット固有のコマンド境界

共通の行動表現テンソルは、その物理的意味が可逆的である場合にのみ安全である。すべてのデータセットとロボット固有の逆マップを通じて、ネイティブの意味論、妥当性、タイミングを保持します。