ロボット VLA 量子化と蒸留

ロボット VLA 圧縮は、画像や言語をタイムリーなロボット行動に変換するモデルの能力を維持しつつ、メモリ、計算、帯域幅、エネルギーを削減します。量子化は数値表現を変えます。蒸留は教師から小柄な生徒を訓練します。アーキテクチャの変更は計算自体を変えます。

決定的なベンチマークは、センサー入力から制御期限と熱負荷のもとでのデコード動作までの正確な展開経路です。ファイルが小さくても、オフライン損失が少なくても、カーネルの高速化、テールレイテンシの低さ、クローズドループの安定した挙動が保証されるわけではありません。

このガイドを VLA ファインチューニングガイドアクショントークン化ガイドと一緒にご利用ください。精度を変える前に、圧縮されていないベースラインを凍結します。

配備基準を凍結する

ピンモデルおよびプロセッサのチェックサム、トークナイザー、アクションデコーダ、正規化、ランタイム、カーネル、コンパイラ、デバイス、電力モード、制御レートおよび評価試験。コールドとウォームの挙動を記録し、圧縮が異なるキャッシュやバッチ条件を受け取らないようにします。

重み、ピークメモリ、入力から初回アクションまでのレイテンシ、定常状態およびテールレイテンシ、エネルギー、温度、スロットリング、デコードされたアクション、タスク成功率、安全イベントを測定します。

スタンフォードAIラボで展示されているスタンフォードカートと初期のロボットアーム
ロボットの計算は長い間、展開可能なハードウェアによって制約されてきましたが、写真は現代の VLA 量子化や蒸留性能を示していません。出典: スティーブ・ジャーヴェットソン(Wikimedia Commons)ライセンス: CC BY 2.0

別々の重み、アクティベーション、キャッシュ精度

ウェイトのみ量子化はパラメータの記憶容量を減らしますが、アクティベーションやキーバリューキャッシュメモリは変更されない場合があります。活性化量子化は帯域幅を節約できますが、外れ値に対してはより敏感です。キャッシュの精度は、長時間の視覚言語コンテキストで重要です。

モジュールとテンソルクラスによる精度のドキュメント化。4ビットと宣伝されているモデルでも、より高精度な埋め込み、ノルム、ヘッド、またはフォールバック演算子を含むことができます。

方法予備選挙の変更ポテンシャルゲイン一次リスク
重量のみのPTQ蓄積重りメモリと帯域幅カーネルフォールバック
重量活性化PTQ重みと活性化より多くの計算コスト削減外れ値誤差
QATトレーニングには量子化が含まれます低ビット回復訓練費用
蒸留小柄な生徒エンドツーエンド還元教師バイアス
建築の変更注意またはトークンパス複雑性低減レシピ固有の回帰

まずは訓練後の量子化から始める

PTQはキャリブレーション統計を用いて訓練済みモデルを変換し、最も速いベースラインです。チャネルごとまたはグループごとの選択、外れ値処理、モジュールの高精度維持をテストします。最も低いビット幅が最適な展開ポイントだと決めつけないでください。

Current Transformersのbitsandbytesドキュメント では、サポートされた8ビットおよび4ビットパスとハードウェア制約が説明されています。サポートが変わるので、ドキュメントとライブラリのバージョンをピン留めしてください。

代表的な校正データを使用する

キャリブレーションの例は、ターゲットカメラ、照明、命令の長さ、オブジェクト、アクション、レアトークン、故障状態をカバーすべきです。一般的な画像は、ロボット固有の視覚ストリームやアクションデコードによって生じる起動範囲を見逃すことがあります。

トレーニングや指定された校正分割データを選択し、最終テストは絶対に選ばないでください。ドメインカバレッジとセットサイズおよびサンプリングに対する感度を報告します。

必要な量があってQATに移行するのが良いです

量子化対応訓練は、モデルにシミュレートされた丸めやクリッピングをさらし、適応させるために、しばしばより高いエンジニアリングコストや計算コストを伴います。QATを自動的に優位とみなすのではなく、同じビット配置と評価でPTQと比較してください。

基地の能力を保護し、適切な場合は低学習率や段階的な解凍を用いましょう。バージョンはフェイク量子化の観測者、距離、そしてチェックポイントとのエクスポートパスを組み合わせています。

5段階ロボット VLA 圧縮検証
オフラインの類似性は、クリップされたアクションテール、遅いフォールバックカーネル、累積されたクローズドループエラーを見逃すことがあります。出典:Physical AI Lab。

蒸留分布と作用構造

知識蒸留は、教師の論理的指標、中間表象、注意、行動分布、または軌跡レベルの行動にマッチさせることができます。古典的な 蒸留論文 は、軟化した予測情報の伝達を動機付けていますが、ロボットの方針には行動と時間認識のある目標が必要です。

教師のミスが無批判にコピーされないように、現場での監督と安全ペナルティを維持しましょう。教師なしで訓練した同規模モデルと生徒の成果を比較してください。

物理単位での行動誤差の測定

教師モデルと圧縮モデルを、正確なトークナイザー、逆正規化、コントローラーインターフェースで比較します。ジョイント、デカルト、グリッパー、モバイルベースの誤差、クリッピング、符号の変化、アクションチャンクの発散を時間経過で報告します。

クローズドループフィードバックでは、わずかな1ステップ差が累積することがあります。簡単なデモンストレーションだけでなく、接触、回復、境界付近のケースも含めましょう。

プロファイル、実際のカーネルとメモリ移動

ビット幅は速度を直接決めるわけではありません。サポートされていない操作は、デクォンタイズ、CPUへの転送、または遅いカーネルの使用があります。小ロットでは加速器の使用不足が生じます。メモリコピーや画像の前処理が支配的になることがあります。

ターゲットデバイス上でオペレーターレベルのトレースをキャプチャします。割り当てられたピークメモリと予約メモリ、転送、カーネル時間、同期、フォールバックカウントを報告します。

寒冷、暖かい、尾部、熱状態のテスト

モデル負荷と初回推論、ウォームされた定常状態、長期的高パーセンタイルレイテンシ、熱飽和後の性能を測定します。現実的なカメラレート、コンテキストの長さ、並行する知覚や安全プロセスを含めてください。

平均レイテンシは満たしているものの、稀な締め切りを逃すモデルは、古いコマンドやスキップされたコマンドを生成することがあります。タイムアウトの挙動を定義し、リソース競合で検証します。

モデルとハードウェアへのスコープ研究成果

SARA-RTは 論文で、研究されたロボティクストランスを線形注意型変圧器にアップトレーニング(UP-training)で変換したと報告しています。 QuantVLAプロジェクト は、その構成 VLA 量子化作業を報告しています。

どちらも他のモデル、ランタイム、ロボットの普遍的なスピードアップを確立するものではありません。報告された比率を使用する前に、正確な精度、アーキテクチャ、装置、タスク条件を再現してください。

実機で閉ループ回帰試験を行う

同一のホールドアウト試験で、マッチングリセットポリシー、可能な限りシード、十分な反復を用いて、未圧縮および圧縮パッケージを評価します。成功、時間、介入、衝突マージン、回復および故障メカニズムを測定します。

OpenVLAリポジトリは、サポートされるチェックポイントの実装コンテキストを提供します。すべてのVLAアーキテクチャが同じ圧縮パスを共有していると仮定するのではなく、バージョン固有のデプロイコードを検査してください。

ベンチマーク測定警告判決
保管遺物と記憶ファイルが縮むのはプロファイル実行時間
レイテンシ中央と尾締め切りの失敗拒否またはフォールバック
持続クロックと電力スロットリングデザインの変更
戦闘復号物理誤差尾部の切り取り精度を上げる
クローズドループ成功と安全オフラインのみのパリティ離さないでください

測定されたパレートフロンティアから選択

プロット、記憶、持続遅延、エネルギー、課題成果を複数の精度および学生構成で評価します。優先的な選択肢を排除し、コスト最適化前に厳格な安全と期限のゲートを適用しましょう。

以下のチェックを伴ったクローズリリースレビュー。

  • 圧縮されていない展開時のベースラインを正確に凍結します。
  • 代表的なロボットデータのみでキャリブレーションしてください。
  • プロファイルカーネル、転送、熱テールレイテンシ。
  • 復号されたアクション誤差を物理単位で測定します。
  • リリース前にクローズドループタスクと安全回帰を義務付けてください。

よくある質問

4ビット VLA は常に8ビットモデルの2倍速いのでしょうか?

いいえ。カーネルサポート、メモリ移動、バッチサイズ、量子化されていないモジュールが速度を決定します。

LoRAは推論を小さくするのでしょうか?

必ずしもそうとは限りません。LoRAは訓練可能なパラメータを削減します。ベースモデルと実行時間は同じサイズのままにすることができます。

PTQとQATのどちらを先に試すべきでしょうか?

測定されたPTQベースラインから始め、ターゲットの低ビット構成が失敗し、トレーニングコストが正当化されるとQATを使いましょう。

オフラインのアクションエラーがロボットトライアルの代わりになるのでしょうか?

いいえ。クローズドループの蓄積、レイテンシ、コントローラの相互作用にはハードウェア評価が必要です。

蒸留と量子化は組み合わせることは可能でしょうか?

はい、しかし、固定された教師の基準やクローズドループゲートと照らして、順序ややり取りをテストしてください。

圧縮から閉ループ境界

ロボット VLA 圧縮はファイルサイズの競争ではなく、デプロイ最適化です。正確なタイミング、メモリ、電力、デコードされたアクション、クローズドループの証拠から選択できます。