ロボットのDiffusion Policy:行動のノイズ除去とリシーディングホライズン制御

ロボット拡散ポリシーは、ノイズの多いアクションシーケンスから行動を発生させ、最近の観測値を条件付けて反復的にノイズ除去を行います。学習された分布は、同じシーンに対して複数のもっともらしい挙動を表すことができ、これは課題を真に多様に達成する方法を含むデモンストレーションに有用です。

この方針はロボット制御スタック全体を指すわけではありません。観測キャプチャ、正規化、推論スケジューリング、コマンド変換、補間、サーボ制御、制限、保護反応などがすべてその周囲に配置されています。予測期間と実際に実行された短い部分が、システムが新しい証拠にどれだけ速く対応できるかを決定します。

このガイドは ロボットアクションチャンクガイド および ロボットセンサーフュージョンガイドと一緒にご利用ください。一つのベンチマーク改善を普遍的な結果として扱うのではなく、目標の具現化とタスク分布に関する拡散ポリシーを評価してください。

拡散は条件付き作用分布をモデル化します

単一の回帰ターゲットを用いた挙動クローンは、互換性のないデモンストレーションを平均化し、示されたモードに属さないアクションを生み出すことがあります。拡散対物レンズは、観測条件に合致する動作配列分布の領域にノイズを変換する方法を学びます。したがって、異なるサンプルは異なる有効なモードを表現することができます。

公式の 拡散ポリシープロジェクト は、リシーディングホライズン実行を伴う動作空間における条件付きノイズ除去を記述しています。この手法は孤立したコマンドではなくシーケンスを予測しますが、マルチモーダリティは正しい意図を保証するものではありません。データセットのカバレッジや条件付けによって利用可能なモードが決定されます。

Open X-Embodimentによるさまざまなロボットの実体化および操作データセットのモザイク
クロスエンボディメントデータセットはポリシーを異なるカメラ、アーム、グリッパー、タスクに公開しますが、すべての展開にはエンボディメント固有の評価が必要です。出典: Google DeepMind Open X-Embodiment。非コード素材のライセンス:CC BY 4.0

トレーニングはノイズを加え、逆方向を覚えます

訓練中、サンプリングされた拡散時間ステップで、クリーンに実証された作用シーケンスが攪拌されます。ニューラルネットワークはノイズの多いシーケンス、タイムステップ、観測の特徴を受け取り、追加されたノイズや同等のパラメータ化などのノイズ除去対象を学習します。ノイズのスケジュールとターゲットの定義は、推論時に使用されるサンプラーと一致しなければなりません。

アクションには一貫したユニット、順序付け、正規化が必要です。ジョイントポジション、デカルトデルタ、回転、グリッパーコマンドは異なるスケールとトポロジーを持っています。回転は既知の不連続点を持つ表現を用いるべきであり、有界グリッパー状態は別の処理が必要になる場合があります。動作インターフェースが曖昧であれば、物理的に一貫性のないコマンドを生成しつつも損失を最小限に抑えることができます。

推論は候補地帯全体を精緻化します

実行時には、ポリシーはノイズからアクションホライズンを初期化し、観測履歴を条件に有限の逆更新シーケンスを適用します。最終的な数列はサンプルであり、決定論的最適化証明ではありません。ランダムなシード、サンプリングスケジュール、ステップ数、ガイダンスの選択は出力とレイテンシの両方に影響を与えます。

センサー露出からコマンド適用までのエンドツーエンドの時間を測定します。GPUカーネル時間だけではイメージ転送、前処理、キューイング、コントローラーハンドオフが省かれています。ノイズ除去パスが観測間隔より遅い場合、古いフレームや重複するリクエストには、無制限コールバックキューではなく明示的なポリシーが必要です。

地平線またはレート意味主なトレードオフログ
観測地平線過去に供給された状態コンテキストとメモリの違い最古のデータ年齢
予測期間生成されたアクション一貫性と不確実性シーケンス長
実行期間リフレッシュ前に適用されたアクション効率と反応性の比較適用プレフィックス
拡散ステップサンプルごとのリバース更新品質とレイテンシの違いサンプラーの持続時間
サーボレートハードウェアコマンドの更新滑らかさと帯域幅の比較アプリケーションタイムスタンプ

リシーディングホライズン実行はループを閉じます

一般的な設計では、予測された配列の最初の部分のみを実行し、再度観測して置換配列を生成します。これはスケジューリングレベルでのモデル予測リシーディングホライズン制御に似ていますが、学習された生成元が動力学制約に縛られた最適制御問題をオンラインで解決しているわけではありません。

実行プレフィックスはタスクスピード、コンタクト感度、推論予算から選択できます。長いプレフィックスはコヒーレントモーションを保ち、計算負荷を減らしますが、攪拌に対しては遅い反応を示します。非常に短い接頭辞は頻繁に再計画されますが、不連続性を生んだり、サンプリングのばらつきを露呈させたりします。リクエストされた、生成された、実際に適用した地平線を別々に記録してください。

5段階拡散ポリシーロボット制御ループ
観測地帯、アクション地平線、ノイズ除去時間、実行プレフィックスが実の制御契約を作り出します。出典:Physical AI Lab。

観測条件付けは修正可能な誤差を定義します

画像、固有受容感覚、力、言語の特徴は訓練中と同様に同期・正規化されなければなりません。カメラのクロップ、レンズ、露出、フレームの順序付け、ロボットの状態の慣習は入力分布を変える可能性があります。一見小さなサイズ変更やエンドポイントフレームの変更が学習したマッピングを無効にすることがあります。

同時に複数の証拠があると仮定するのではなく、タイムスタンプ付きの履歴を使いましょう。視覚が遅れて現れる場合、現在の固有受容感と古い画像は実体状態を捉えません。データ増強は計画的な変動に対する許容性を向上させることができますが、展開テストでは依然として代表的な照明、視点、遮蔽、キャリブレーションのシフトが必要です。

アクション表現と低レベルのコントローラーが交差します

ポリシーは共同目標、デカルトデルタ、速度、または正規化された抽象的行動を予測することがあります。ダウンストリームコントローラーはそれらの値をトルクや運動に変換し、自身のゲイン、補間、リミットを適用します。したがって、ポリシーの再現にはモデルのチェックポイントだけでなく、アクション変換とコントローラの設定が必要です。

ロボットの位置、速度、トルク制御ガイド、そしてリアルタイム制御ガイドとROS 2制御の詳細を調整してください。クランプレート、作業空間、力を決定論的かつ検証可能な層で設定し、トレーニング例がハードウェアの制限を強制するとは限りません。

データセットの多様性はデプロイカバレッジではありません

Open X-Embodimentリポジトリは、オープンロボットデータセットを共通の形式に統合し、ソフトウェアライセンスと非コード素材のライセンスを区別しています。大規模なコレクションは事前訓練の範囲を広げることができますが、そのカメラジオメトリ、アクションスペース、タスクラベル、身体構成が新しいロボットに対して自動的にバランスを取るわけではありません。

データセットごとのサンプリング、重複、失敗例、アクション変換の監査。ターゲットグリッパー、オブジェクト、ディストラバンスを含む展開固有の分割を維持しつつ、モデル選択には使用されません。クロスエボディメントの前訓練は検証のための仮説であり、キャリブレーションや運動学の違いが消えた証拠ではありません。

評価軸マッチドテストシフトテスト失敗の証拠
対象物保留された事例新しい形状と素材誤った接触
視点訓練用マウントカメラ変位視覚的誤局在
言語既知の表現言い換えと気をそらす方法間違ったサブタスク
動力学公称ペイロード質量変化と摩擦変化オーバーシュートかドロップか
タイミング通常計算負荷遅延観測スタイアアクション

サンプリングの変動は制御された評価を必要とします

推論は確率的である可能性があるため、1つの開始状態が異なる列をもたらすことがあります。ソフトウェア変更を比較する際にシードを固定し、複数のシードで運用の変動を測定します。ポリシーのランダム性と制御されていない物体配置やセンサーノイズを、再生可能な観測や計測器具を通じて分離します。

試行数、成功定義、信頼区間を報告してください。多くのサンプルから最も視覚的に魅力的な展開を選び、却下された試みを数えずに選ばないでください。複数の候補配列をサンプリング・ランク付けする場合、ランキングモデルと追加の計算は展開されたシステムの一部となり、それぞれ独自のアブレーションが必要です。

安全性は学習成功指標の外に属します

タスク成功は衝突エネルギー、関節制限の近接、安全でない作業空間への侵入、または人間の介入を測定するものではありません。ログ保護停止、接触、ピークフォース、落下物、作業員による作業の引き継ぎなど、作業が最終的に完了しても対応します。危うい失敗は二元的な成功のラベルの中に隠すべきではありません。

決定的なコマンドチェック、衝突監視、アプリケーションに適した適格な安全アーキテクチャを活用してください。破損した画像、遅延状態、サンプラーのタイムアウト、NaN出力、範囲外のアクションをテストしてください。自律試験前の各ケースのフォールバックを定義し、ロボットが保持するか、撤退するか、安全状態に入るかなどを含みます。

デプロイメントレビューはモデルの証拠をハードウェアに結びつけます

拡散ポリシーの論文および公式実装は、この手法および報告された実験の主要な参考文献です。複製はピンコード、チェックポイント、データセットの改訂、サンプラー、画像変換、アクション慣例、コントローラーを含みます。なぜなら、それぞれが実行可能ポリシーを変更するからです。

オフラインアクションリプレイから始め、ガードされたテストフィクスチャーを使い、次にオブジェクト、ポーズ、ライティング、妨害の範囲を広げます。すべての裁判で動画と同期された生のテレメトリーを保持してください。ポリシーの遅延、故障の分類法、保護行動が書面での運用範囲に合致する場合にのみ推進してください。

  • ピン観察とアクションの慣習。
  • 完全なノイズ除去とコマンドレイテンシを測定します。
  • 予測の領域と実行接頭辞を分けてください。
  • 種や物理的な変化を越えて繰り返し試行錯誤。
  • 決定論的限界や保護反応は独立しておきましょう。

よくある質問

拡散方針はビジョン・言語・行動モデルと同じものなのでしょうか?

いいえ。拡散は作用生成メカニズムを表します。 VLA ポリシーは、特定のアーキテクチャにおいて言語とビジョンも用いています。拡散を使う場合もあれば、使わない場合もあります。

なぜ行動を連続して予測するのか?

シーケンスは時間的な一貫性を保ち、短い行動セグメントを表すことができます。システムは依然としてプレフィックスのみを実行し、新しい観測から再計画を行うことができます。

ノイズ除去を多くすれば必ずロボットのパフォーマンスが向上しますか?

いいえ。余分なステップはレイテンシを増やし、効果が逓減することがあります。有用な設定は、展開されたサンプラー、ハードウェア、タスクで測定する必要があります。

保険は直接モーターを指示できますか?

通常、下位のコントローラーは予測されたジョイントターゲットやデカルトターゲットをハードウェアコマンドに変換します。そのインターフェースとその制限はシステムの一部です。

マルチモーダル挙動はどのように評価すべきでしょうか?

シード間でマッチングスタート状態を繰り返し、すべての試みをカウントし、モードの適切性を検査し、タスク、安全性、変動性の指標を報告し、単一の展開ではなく。

拡散ポリシー展開境界

拡散ポリシーは、その訓練分布の下で学習されたアクションシーケンスを生成します。それだけでは物理的なロボットの運動学的実現可能性、制御安定性、衝突回避、機能的安全を保証するものではありません。