機器人 VLA 壓縮減少記憶體、計算、頻寬或能量,同時保持模型將影像和語言轉化為及時機器人動作的能力。量化改變數字表示;蒸餾從教師中培養較小的學生;架構變更改變計算本身。
決定性的基準是從感測器輸入到解碼動作的精確部署路徑,且在控制截止時間和熱負載下。檔案較小或離線損失較低並不保證核心更快、尾延遲降低或閉環行為穩定。
將本指南與 VLA 微調指南 及 動作詞元化指南一起使用。在調整精度前,先凍結未壓縮的基線。
凍結部署基線
引腳模型和處理器校驗和、分詞器、動作解碼器、規範化、執行時、核心、編譯器、裝置、電源模式、控制速率和評估試驗。記錄冷溫行為,確保壓縮不會接收不同的快取或批處理條件。
測量權重、峰值記憶體、輸入到首次動作延遲、穩態和尾部延遲、能量、溫度、節流、解碼動作、任務成功率和安全事件。

獨立權重、啟用次數和快取精度
僅權重量化減少參數儲存,但可能保持啟用和鍵值快取不變。啟用量化可以節省頻寬,但對異常值更敏感。快取精度在長視覺語言上下文中非常重要。
按模組和張量類進行檔案精度。標榜為四位的模型仍可包含更高精度的嵌入、範數、頭或備份算符。
| 方法 | 初選變動 | 潛在增益 | 主要風險 |
|---|---|---|---|
| 僅重量 PTQ | 儲存權重 | 記憶體與頻寬 | 核心回退 |
| 權重啟用 PTQ | 權重與啟用 | 更多的計算節省 | 離群值誤差 |
| QAT | 訓練內容包括量子化 | 低位恢復 | 培訓費用 |
| 蒸餾 | 小學生 | 端對端約簡 | 教師偏見 |
| 架構變革 | 注意或標記路徑 | 複雜度簡化 | 配方特定迴歸 |
從訓練後量化開始
PTQ 透過校正統計轉換為訓練好的模型,是最快的基線。測試可按通道或組進行選擇測試,並保持更高精度的模組。不要假設最小的位寬是最佳可部署點。
目前 Transformers bitsandbytes 檔案 描述了支援的 8 位和 4 位路徑及硬體約束。釘住檔案和庫版本,因為支援會變。
使用具有代表性的校正資料
校正示例應涵蓋目標攝影機、光照、指令長度、物體、動作、稀有標記和失效狀態。通用影像可能會錯過由機器人特定視覺流和動作解碼所建立的啟用範圍。
從訓練或指定的校正分段中選擇校正資料,絕不選擇最終測試。報告對集合大小和抽樣的領域覆蓋及敏感度。
只有在有明確需求時才轉到 QAT
量化感知訓練使模型暴露於模擬的舍入和削波,使其能夠適應,但通常需要更高的工程和計算成本。在相同的位元佈局和評估下與 PTQ 進行比較,而不是將 QAT 視為自動優越。
保護基地能力,並在適當情況下使用低學習率或分階段解凍。版本對觀察者、距離和輸出路徑進行假量化,並設定檢查點。

蒸餾分佈與作用結構
知識蒸餾可以匹配教師邏輯、中間表徵、注意力、行動分佈或軌跡級行為。經典 的蒸餾論文 鼓勵傳遞軟化的預測資訊,但機器人策略需要行動和時間感知目標。
保持實地監督和安全懲罰,避免教師錯誤被無條件複製。將學生的進步與未由教師培訓的同規模模型進行比較。
以物理單位衡量作用誤差
在精確分詞器、逆正規化和控制器介面後,比較教師模型與壓縮模型。報告聯合、笛卡爾、夾爪和移動基準誤差、裁剪、符號變化以及作用塊發散隨時間的變化。
在閉環回饋下,每步的微小差異可能會加劇。應納入接觸、恢復和近邊界案例,而非僅評估簡單展示。
設定檔、實際核心與記憶體移動
位寬並不直接決定速度。不支援的操作可能會去量化、傳輸到 CPU 或使用較慢的核;小批次可能減少加速器使用;記憶體複製和影像預處理可能占主導地位。
在目標裝置上捕獲操作員級跟蹤。報告峰值分配和保留記憶體、傳輸、核心時間、同步和備援計數。
測試冷、暖、尾部和熱溫條件
測量模型載入與首次推論耗時、預熱後的穩態效能、長時間執行的高百分位延遲,以及熱飽和後的效能。測試應採用真實相機影格率、上下文長度,幷包含併發的感知或安全流程。
一個模型達到平均延遲但錯過罕見截止日期,可能會產生過時或跳過的命令。定義超時行為,並在資源爭用中驗證。
模型和硬體的範圍研究成果
SARA-RT 在其 論文中報告透過上級訓練將研究中的機器人變換器轉換為線性注意力變體。 QuantVLA 專案 報告了其所述設定中的 VLA 量化工作。
這兩種方法都無法為其他模型、執行時或機器人建立通用加速。在使用報告的比率前,先精確復現精度、架構、裝置和任務條件。
對機器人執行閉環迴歸
在相同且保留的試驗中評估未壓縮和壓縮包,採用匹配重置策略、可能的種子和足夠的重複次數。衡量成功率、時間、介入、碰撞餘裕、恢復和失敗機制。
OpenVLA 倉庫為支援的檢查點提供實現上下文;檢查特定版本的部署程式碼,而不是假設所有 VLA 架構共享相同的壓縮路徑。
| 基準測試 | 度量 | 警告 | 判決 |
|---|---|---|---|
| 儲存 | 模型檔案與記憶體佔用 | 只有檔案會收縮 | 分析執行時效能 |
| 延遲 | 中位數與尾部延遲 | 截止日期錯過 | 拒絕或退回 |
| 熱成像 | 持續時鐘與電源 | 節流 | 變革設計 |
| 行動 | 解碼物理錯誤 | 尾部剪裁 | 提高精度 |
| 閉環 | 成功與安全 | 僅離線的奇偶關係 | 不要釋出 |
從測量的帕累託邊界中選擇
繪製多種精度和學生設定的記憶體、持續延遲、能量和任務結果。在最佳化成本前,去除被支配的選項,並實施硬性安全和截止日期門檻。
關閉釋出審查,需進行以下檢查。
評估“機器人 VLA 量化與蒸餾”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。
只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。
上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。
實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。
把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。
引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。
小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。
所有結論都應能夠追溯到原始記錄,並可複核。
介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。
異常測試應覆蓋斷電、通訊丟失、感測器失真、物件滑移和人員進入工作區等情形。系統不僅要發現異常,還應以可預測的方式減速、停止或請求人工確認。
- 凍結準確的未壓縮部署基線。
- 僅根據代表性的機器人資料進行校正。
- 設定檔核心、傳輸和熱尾延遲。
- 以物理單位測量解碼後的動作誤差。
- 要求在釋放前進行閉環任務和安全迴歸。
常見問題
4 位 VLA 總是 8 位模型的兩倍快嗎?
不。核心支援、記憶體移動、批處理大小和未量化模組決定速度。
LoRA 會讓推論更小嗎?
不一定。 LoRA 會減少可訓練參數;基礎模型和執行時大小可能保持不變。
應該先試 PTQ 還是 QAT?
先以測量的 PTQ 基線開始,當目標低位設定失效且訓練成本合理時再使用 QAT。
低離線動作錯誤能取代機器人試煉嗎?
不行。閉環累積、延遲和控制器互動都需要硬體評估。
蒸餾和量化能結合使用嗎?
是的,但要將順序和互動與固定教師基線和閉環門進行測試。
壓縮到閉環邊界
機器人 VLA 壓縮是一種部署最佳化,而非檔案大小的競賽。從精確的裝置時序、記憶體、功耗、解碼動作和閉環證據中選擇。