ロボットアクションチャンク:ACT、時間アンサンブル、クローズドループ実行

アクションチャンクは、ロボットポリシーに対して1つのクエリに対して1つのアクションではなく、複数の将来のアクションを同時に予測するよう求めます。一貫したチャンクは、長い操作タスクにおける高レベルの意思決定の数を短縮し、デモンストレーションから得た動き構造を保持できます。また新たな疑問も生まれます。つまり、その塊のうちどれだけを再度観察する前に信頼すべきか?

トランスフォーマーによるアクションチャンク(ACT)は、ALOHAで導入された特定の模倣学習方法です。ACTは条件付き変分オートエンコーダとトランスコンポーネントを用いて、画像やロボットの状態からアクションシーケンスを予測します。アクションチャンクはより広いデザインパターンです。すべてのチャンクポリシーがACT、CVAEまたは同じ時間アンサンブルを使用しているわけではありません。

このガイドは 拡散方針ガイド および ロボットジョイント制御ガイドと併用してください。予測チャンク、ハードウェアに適用された部分、次の観測時間を別々の測定可能な量として扱います。

アクションチャンクは効果的な意思決定の期間を短くします

数千サーボサイクルに及ぶタスクでも、各ポリシークエリが短い軌道セグメントを予測する場合、高レベルの選択数が少なくて済みます。セグメント内のアクションはコンテキストを共有し、独立したワンステップ予測によるジッターを減らし、協調した両手または接触力のある動きを表現するのに役立ちます。

ディレーティングは無料ではありません。実行されたチャンク内の誤りは、次の観測までに蓄積されることがあります。したがってチャンク化は、問題の一部をステップごとの予測から地平線選択とクローズドループスケジューリングへとシフトさせます。長い予測は、ロボットがオープンループで実行しなくても文脈として有用です。

国際宇宙ステーションでロボノート2のハードウェアを扱う宇宙飛行士
テレオペレーターによるデモンストレーションは時間をかけて協調した行動を維持できますが、学習したチャンクは遅延、乱れ、ハードウェアの制限に対してテストする必要があります。出典: NASA。利用条件: NASAメディア利用ガイドライン

ACTは一つの具体的なチャンクアーキテクチャです

公式 のALOHAプロジェクト では、細かな双手操作のためにチャンク単位の動作を予測するACTを導入しています。この方針は、視覚受容と固有受容性入力をトランスベースの条件付き変分自動符号器と組み合わせ、訓練中に潜在変数を用いてデモンストレーションの変動を表現します。

展開時には、ACTは一般的にデモンストリースタイルラベルの要求ではなく、決定論的な事前平均を使用します。アーキテクチャ、カメラエンコーダ、潜在処理、アクション正規化は、ピン留めすべき実装の詳細です。報告されたALOHAタスクやデータ効率はそのセットアップの証拠であり、すべてのロボットの一般的な成功保証ではありません。

予測、実行、クエリの各範囲が異なります

チャンク長はモデルが予測する将来の行動の数です。実行期間はシステムがそれらを置き換えるまでに送信された数であり、クエリ間隔は次の予測が始まる時刻を指します。一部の実装では、すべての制御ステップをクエリし、重複を組み合わせます。他のものは推論負荷を減らすためにプレフィックスを実行します。

各地平線をステップと秒数で表現します。同じ100ステップのチャンクは、100Hzで1秒、10Hzで10秒を意味します。また、推論遅延や、新しい予測が観測時間に一致しているか、計算終了時と一致しているかも報告します。

数量定義短すぎる長すぎる
予測チャンク今後の行動が生まれた弱い時間的文脈不確かな遠い未来
実行プレフィックス置き換え前に適用されたアクション計算負荷とジッター負荷遅い撹乱応答
クエリ間隔ポリシー要求間の時間キュー競合古くなった計画
観測の歴史過去の証拠曖昧な動き記憶と古い文脈
サーボ周期ハードウェアターゲットのアップデート粗い制御タイミング需要

時間的アンサンブルは、重複する予測を組み合わせる

ACT論文では、頻繁なクエリが同じ未来タイムステップに対して複数の予測を生成します。時間的アンサンブルは、これらの重複する推定値と、より最近の予測に有利な重みを組み合わせます。これにより、チャンク間の変化を滑らかにしつつ、新しい観測も取り入れることができます。

行動の平均化は必ずしも中立ではありません。デカルト回転、離散グリップ状態、多モーダルの代替法には、補間が意味のある表現が必要です。2つの個別に有効な戦略が平均されて無効な中間になることがあります。寄与する予測値や重みをログに記録し、平滑化失敗とモデル誤差を区別できるようにしましょう。

5段階ロボットアクションチャンク実行ループ
予測チャンク、実行プレフィックス、クエリレートは別々の設計選択です。出典:Physical AI Lab。

チャンク長はタスクダイナミクスと接触に従います

フリースペースリーチングは挿入、グラップクロージャー、工具接触よりも長い接頭辞を許容することがあります。予想される妨害時間、カメラレート、推論尾部、低レベルのコントローラ帯域幅から地平線を選択します。フェーズ遷移の近くでリフレッシュを短くするか、タスクステートマシンにポリシースケジュールを変更させましょう。

ホールドアウトの試験ではチャンクとプレフィックスを独立してスイープします。完了、介入、指令の不連続性、移動物体への反応を測定します。静的なデモンストレーションで好成績を収めるホライズンは、接触タイミングが変わると失敗することがあります。なぜなら、物理的なイベントが変わった後も方針が記憶済みのセグメントを続けるからです。

デモンストレーションには時間的な整合性と多様性が必要です

テレオペレーションログは、人間の意図、カメラフレーム、ロボットの状態、指令された行動を結びつけます。これらのストリーム間の遅延はポリシーに遅れて反応する方向に教えてしまいます。元のタイムスタンプを保持し、テレオペレーション遅延を推定し、アクションラベルが望ましいロボット状態を表すのか適用された状態を表すのかを定義します。文書化されたルールのもとで破損したサンプルのみを削除してください。

物体のポーズ、アプローチ、修正、回復の変化を集め、単なる名目上の成功だけでなく。学習者は、デモンストレーションに欠けている状態からどう回復するかを推測することはできません。繰り返しのタスクとオペレーターのバランスを取って、最大のセッションが支配的でないようにし、トレーニングと評価データを分割する際には連続したエピソードをまとめておくこと。

下位コントローラーはすべてのチャンクを形作ります

予測されたジョイントターゲットは補間、利得、トルク、運動の限界を通過します。もし訓練ロボットが異なるコントローラーレートやインピーダンスを使った場合、同じ数値チャンクでも異なる物理経路を生み出すことができます。コントローラの設定と測定されたアプリケーションタイムスタンプをモデルの成果物とともに保持します。

ロボットのジョイントゲインチューニングガイドおよび衝突検出ガイドと連携して、リミットとトラッキングチェックを連携させます。チャンクは学習された参照シーケンスであり、認定されたモーションプリミティブではありません。サーボ層は、不可能または古くなったコマンドを予測可能に拒否しなければなりません。

故障モード観察可能な症状隔離試験緩和策
陳腐な観察正しい行動は遅すぎました制御遅延の追加短いプレフィックスまたはスケジューリング
チャンク境界ジャンプコマンド不連続性重なるターゲットのプロットアンサンブルまたは遷移ルール
コントローラーの不一致追跡と接触の変更同じターゲットをリプレイマッチインターフェースとゲイン
モード平均化無効な中間行動貢献者を検査する構造化出力または選択
リカバリーデータの不足複利ドリフトタスク状態の途中で摂動修正デモンストレーションを追加してください

クローズドループ擾乱試験は古臭い挙動を露呈します

ポリシーがチャンクを生成した後にオブジェクトを動かしたり、グラプスのタイミングを変えたり、小さなコンプライアンスの偏向を加えたり、カメラを一時的に遮るなど。適用された動作が変化する前に、ロボットの移動が何ミリ秒、どれだけの量が進むかを測定してください。これはシステムが頻繁に再計画するというよりも有益です。

テスト推論のオーバーランと観測値のドロップ。現在の接頭辞を終えるか、最後の境界されたターゲットを保持するか、または停止するかを決めます。古いチャンクをキューイングするのは通常危険です。なぜなら、それぞれが古い状態に条件付けられているからです。シーケンス識別子を使って、どの観測が適用命令を生み出したかを証明します。

評価には進展と失敗分類が必要です

二項課題の成功は、配置中にポリシーが到達したか、理解されたか、解除されたか、失敗したかを隠しています。観察可能なマイルストーンを定義し、知覚、誤った物体、軌道、接触、スリップ、タイムアウト、保護停止の失敗を分類します。たとえオペレーターが試行を救ったとしても、人間の介入は結果としてカウントしてください。

適合およびシフトされた条件の試験数と信頼区間を報告します。同じ初期フィクスチャーをポリシーバージョン間で繰り返し、実行順序をランダム化してウォームアップやオペレーターバイアスを減らします。ビデオはレビューに有用ですが、遅延や境界挙動を測定するためには、コマンドログ、状態ログ、イベントログの同期が必要です。

複製は完全な執行契約を固定します

ALOHAリポジトリは、プロジェクトに関連するハードウェアおよび学習コードを提供しています。有効な複製でもリポジトリの改訂、データセット、カメラ変換、ポリシーレート、チャンクサイズ、時間アンサンブル設定、アクションユニット、ロボットコントローラーが記録されます。

オフラインリプレイ、厳重なハードウェアトライアル、段階的にシフトされたテストを通じて構成を促進しましょう。タスクの開始と妨害の固定回帰セットを維持しましょう。新しいチャンクサイズが平均完了率を向上させる一方で衝突や介入の尾部が増加する場合、その変更は一般的により良い展開を生み出していません。

  • アクションチャンクはACTアーキテクチャと区別されます。
  • 予測、実行、クエリの期間を記録します。
  • デモンストレーションを物理的なタイムスタンプに合わせてください。
  • テストの重複、陳腐な観察、推論のオーバーラン。
  • マイルストーン、介入、不確実性を報告しましょう。

よくある質問

ACTはすべてのアクションチャンクポリシーと同じですか?

いいえ。ACTは特定のCVAEおよびトランスフォーマーの模倣学習手法です。他のアーキテクチャもアクションチャンクを予測し実行できます。

ロボットは予測された全てのチャンクを実行するべきでしょうか?

必ずしもそうとは限りません。多くのシステムはチャンク終了前に再度クエリを行ったり、重複する予測を組み合わせたりします。安全な選択は遅延、タスクの動態、そして乱れによって異なります。

時間的アンサンブルは何をするのでしょうか?

同じタイムステップをターゲットにした複数の予測を組み合わせ、新しい予測に対してより強い重み付けをすることが多いです。アップデートをスムーズにできますが、互換性のないモードを平均化することもあります。

アクションチャンクは軌道計画とどう違うのですか?

学習されたチャンクはデータから行動を予測します。モーションプランナーは通常、明示的な運動学的または衝突モデルの内部を検索します。どちらもコントローラーへの言及を提供する場合がありますが、保証内容は異なります。

最も重要な展開ログは何ですか?

観察キャプチャ、推論の開始と終了、予測シーケンス、適用コマンド、ロボットの状態を1つのタイムベースにまとめます。そのログは、古びや境界の誤差を露呈させます。

アクションチャンキング制御境界

アクションチャンクは、ロボットインターフェース、コントローラー、データ配信に結びついた学習済みのコマンドシーケンスです。タイミング、実現可能性、接触挙動、防護反応を物理システム全体で検証します。