ロボットアクショントークン化:連続から離散まで

ロボットアクショントークン化は、連続したコマンドをシーケンスモデルが予測可能なシンボルにマッピングします。符号化は一様ビン、分位体ビン、学習コードブック、圧縮シーケンスのいずれかを用いることができますが、すべてのオプションでは単位、範囲、正規化、時間的地平線、復号を含む契約が導入されます。

トークンの精度は運用上の目標ではありません。1ビンの誤差は、ある関節ではほぼゼロに無害ですが、別の関節では接触近くでは危険であり、切れ端は総体損失で消えてしまうことがあります。物理的ユニットおよびターゲットコントローラーを通じて再構築を評価します。

このガイドは VLA ガイドロボットアクションチャンクガイドと一緒に使ってください。トークナイザーとトレーニング統計をモデル依存関係としてバージョン化します。

まず連続行動契約を定義します

命令された数量、座標枠、単位、符号、有効範囲、制御速度、アクチュエータマスクを含むすべての寸法をリストアップしてください。ジョイントポジション、ジョイントベロシティ、デカルトデルタ、グリッパー状態、モバイルベースツイストは、明示的な意味論なしにはトークナイザーを安全に共有できません。

行動が絶対的か相対的か、またどこで統合が行われるかを記録します。7桁の2つの配列は、異なるコントローラーの下で全く異なる動きに復号できます。

バクスターのロボットリストカメラと二本指グリッパーのクローズビュー
アクションベクトルの意味は、ロボット、コントローラー、座標系、グリッパーの慣習によって異なります。写真にはトークナイザーは示されていません。出典: ウィキメディア・コモンズ寄稿者。ライセンス: CC BY-SA 4.0

一様または分位体ビンは意図的に選ぶ

均一ビンは物理的な間隔を均等に保ち、最大の量子化誤差の解釈を容易にしますが、あまり使われない範囲で語彙を無駄にすることがあります。分位列ビンは各トークンにほぼ同じような訓練頻度を割り当て、利用率を向上させつつ物理的な解像度を不均一にします。

トレーニングデータにのみビンエッジをフィットさせて公開します。語彙のパプレキシティだけでなく、次元ごとのデコード誤差や操作領域ごとの誤差を比較してください。

符号化強度一次リスク必須監査
連続回帰直接物理出力スケールの不均衡単位誤差
ユニフォームビン固定物理解像度スパーステールトークンカバレッジとクリッピング
分位体ビンバランストークン周波数不均一物理誤差ビン幅
学習済みコードブック相関関係を捉える死んだコードや不安定なコード使用とデコードドリフト
シーケンス圧縮アクショントークンの減少境界成果物再構築と潜伏期

クリッピングは測定された故障モードとして扱う

適合範囲外の値は、しばしば最初または最後のトークンにクリップされます。これによりテンソル形状は有効に保たれますが、異なる極端なコマンドを同じ記号に変換し、トークン損失による分布シフトを隠します。

ログクリッピング率、規模、次元別タスクコンテキスト。テイル挙動が頻繁かつ重要な場合は、範囲を拡大したり、分布を変換したり、展開を拒否したりします。

物理単位での再構成測定

ポリシーを訓練する前に、トークナイザーを通じてグラウンドトゥルースアクションをデコードします。関節角度、速度、エンドエフェクターポーズ、グリッパー、モバイルベースの誤差を実際の制御レートで報告してください。平均だけでなく、最大および高パーセンタイルの値を含めてください。

再構築したシーケンスを運動学とコントローラーの限界に通してください。小さな成分誤差が積み重なり、チャンク全体で大きなデカルトドリフトや接触力の変化を生じさせることがあります。

トークン化とアクションチャンクの分離

トークン化は値や列を表し、アクションチャンクは将来のコマンドの地平を予測し、それらの実行方法や組み合わせ方法を選択します。モデルは連続チャンク、離散的なステップごとのトークン、または圧縮チャンクトークンを使用できます。

トークン数、チャンクホライズン、オーバーラップ、時間的アンサンブル、後退ホライズンの挙動を別々の実験変数として保持してください。それ以外の場合、遅延や成功の変化はエンコーダに起因しません。

5段階ロボットアクショントークン化の検証
低いトークン損失は、復号後の切断されたジョイント、遅延チャンク、または大きなエンドエフェクタ誤差と共存することがあります。出典:Physical AI Lab。

予算語彙とシーケンスの長さを合わせて

ビンを増やすことでスカラー量子化誤差を減らしつつ、語彙量や予測の難易度を高めることができます。各次元と時間ステップを個別に符号化することで、アクショントークン数を次元や地平線で掛け合わせ、視覚的または言語的な文脈の余地を減らし、復号遅延を増加させます。

エンドツーエンドのプロンプトの長さ、生成トークン数、ファーストアクションレイテンシ、コントロール期限を測定します。コンパクト表現は、その再構成が課題に対して十分である場合にのみ有用です。

FASTを時系列の行動圧縮として捉える

FAST論文は周波数空間アクションシーケンストークン化を提案し、評価対象のロボットデータセットおよびモデルにおける圧縮および訓練挙動の改善を報告しています。関連するRSS論文は査読済みの手法の文脈を提供しています。

FASTはアクションチャンクと同義ではありません。シーケンスをコンパクトに符号化しますが、ポリシーにはターゲットロボットで評価される地平線、デコーダ、実行ルールが必要です。

正規化をトークナイザーにバインドします

多くのパイプラインは、ビニングや回帰の前にアクションディメンションを正規化します。データセットごと、ロボットごと、またはグローバル統計はトークン境界やデコードされた大きさを変えるため、同じトークン識別子は統計なしに安定した物理的意味を持ちません。

クロス エンボディメント正規化ガイド を使って、共有された意味とロボット固有のスケールを区別してください。チェックポイントでマスク、クァタイル、クリッピングポリシー、逆変換をフリーズします。

ハンドルグリッパーと混合アクションタイプについて明示的に

バイナリグリッパーコマンドは、滑らかな関節のように量子化されるべきではありません。ハイブリッドアクションはカテゴリモード、連続モーション信号、終了信号を組み合わせ、それぞれの意味論に適した損失とデコーダを持つことがあります。

レアモードトークンと矛盾するデモンストレーションの監査。頻繁に正しい腕の軌跡と遅れたり逆さまのグリッパートークンを組み合わせても、操作全体が失敗する可能性があります。

契約による研究実施の比較

RT-1は報告されたトランスフォーマーポリシーでトークン化されたロボットアクションを使用し、 RT-2 は研究対象の視覚言語アクション設定でロボットアクションをテキストトークンとして表現します。 OpenVLAリポジトリ には、別の実装インターフェースとアクショントークンインターフェースが記載されています。

ビン数、範囲、デコードの前提を名前でシステム間で転送しないでください。公開されたコードとチェックポイント固有の統計を検査し、ターゲットアクション契約をローカルで再現します。

テストレイテンシ、飽和、ハードウェアリプレイ

実際のコンテキスト長を持つデプロイメントハードウェアでのベンチマークトークン化および自己回帰復号。中央および尾部の遅延、制御期限の遅延、失敗のデコード、飽和状態を測定してから動作を許可してください。

ポリシー出力前にシミュレーションや保護されたハードウェアモードで再構築されたグラウンドトゥルースコマンドを再生します。連続ベースライン、エンコードされたグラウンドトゥルース、学習済み予測を比較し、トークナイズ誤差を目にする。

メートル法警告反応
カバレッジ尾翼とクリップ率コマンドは飽和しています改装範囲
再建物理単位誤差タスクスケールドリフト交換箱
順序地平線あたりのトークン数コンテキストまたはレイテンシスパイク圧縮
コントローラーリミットおよび期限イベント無効な実行フィックス契約
任務成功と安全圏トークンスコアは誤解を招くリリース拒否

トークナイザーバンドルを完全にリリースする

トークナイザーのバージョン、語彙、ビンエッジまたはコードブック、正規化統計、アクションマスク、ユニット、フレーム、コントロールレート、地平線、デコーダコード、チェックサムをモデルとパッケージ化します。これらの成果物のないチェックポイントは再現可能なロボットポリシーではありません。

以下のチェックを伴ったクローズリリースレビュー。

  • すべてのアクションの次元とフレームを記録しましょう。
  • トレーニングデータのみにトークン範囲をフィットさせます。
  • クリッピングや物理的誤りの解読を報告してください。
  • トークン数とテールレイテンシを測定してください。
  • ハードウェアリリース前にパッケージされたデコーダーを正確に再生してください。

よくある質問

離散アクショントークンは連続回帰よりも優れているのでしょうか?

どちらも普遍的ではありません。物理的再構築、ポリシー学習、遅延、課題成果を条件に応じて比較します。

各アクション次元は何個のビンを使うべきでしょうか?

許容される物理誤差、観測されたカバレッジ、モデルの容量から選択し、次元とタスク領域ごとに検証します。

FASTはアクションチャンクと同じですか?

いいえ。FASTはアクションシーケンスを圧縮します。チャンク化は予測と実行のホライズンを定義します。

トークナイザーの統計は訓練後に再計算できますか?

再認証なしでは安全ではありません。なぜなら、変化した範囲や分位数がトークンの物理的な意味を変えるからです。

トークン化アクションモデルで何を保存すべきでしょうか?

語彙、エッジやコードブック、正規化、マスク、フレームおよびユニットの規約、地平線、デコーダ、チェックサムを保存します。

アクション符号化および再構成境界

アクショントークナイザーはロボット制御インターフェースの一部です。トークン損失だけでなく、解読された物理的動き、コントローラーのタイミング、タスクの結果によって評価してください。