機器人動作詞元化:從連續控制到離散編碼

機器人動作令牌化將連續命令對映到序列模型可預測的符號中。編碼可能使用均勻箱、分位數箱、學習碼本或壓縮序列,但每個選項都會引入一個契約,涵蓋單位、區間、正規化、時間視界和解碼。

令牌精度並非操作目標。單箱誤差對一個節點來說接近零可能無害,但對另一個節點近接觸時不安全,而截尾則可能因總損耗而消失。評估物理單元及目標控制器的重建。

本指南應與 VLA 指南機器人動作分塊指南一起使用。將分詞器和訓練統計資料作為模型依賴納入版本管理。

先定義連續行動契約

列出每個維度,包括命令數量、座標系、單位、符號、有效範圍、控制速率和致動器掩膜。關節位置、關節速度、笛卡爾δ、夾爪狀態和移動基座扭轉不能安全地共享分詞器,除非有明確語意。

記錄動作是絕對的還是相對的,以及積分發生的位置。兩個七個數字的陣列可以解碼為在不同控制器下完全不同的運動。

巴克斯特機器人腕部攝影機和兩指夾具的特寫檢視
動作向量的含義取決於機器人、控制器、座標框架和夾爪約定;照片中沒有展示分詞器。來源:維基共享資源貢獻者。許可:CC BY-SA 4.0

有意識地選擇均勻或分位數的箱

均勻分箱保持相等的物理間距,使最大量化誤差易於解釋,但它們可能會浪費詞彙量在很少使用的範圍內。分位數分組為每個標記分配相似的訓練頻率,提高利用率,同時使物理解析度不均勻。

僅擬合訓練資料的箱邊併發布。比較不同維度和操作區域的解碼錯誤,而不僅僅是詞彙困惑度。

編碼實力主要風險必須進行的審計
連續迴歸直接物理輸出音階失衡單位誤差
均勻分箱固定物理解析度稀疏尾部標記覆蓋與剪輯
分位數箱平衡令牌頻率物理誤差不均箱寬
學習碼本捕捉相關性死程式碼或不穩定碼使用與解碼漂移
序列壓縮行動標記減少邊界偽影重建與延遲

將削波視為測量的失效模式

超出擬合範圍的值通常會被裁剪到第一個或最後一個令牌上。這樣可以保持張量形狀的有效性,同時將不同的極端命令轉換成同一符號,並隱藏因令牌丟失引起的分佈偏移。

按維度計算對數裁剪率、大小及任務上下文。當尾部行為頻繁且重要時,擴充範圍、變換分佈或拒絕部署。

以物理單位計量重構

在訓練策略前,透過標記器解碼真值動作。報告關節角度、速度、末端效應器姿態、夾爪和移動基座的實際控制率錯誤。包含最大值和高百分位數值,而不僅僅是平均值。

將重建序列透過運動學和控制器極限執行。小的分量誤差可能累積成塊塊上的大型笛卡爾漂移或接觸力變化。

將令牌化與動作分塊區分開

分詞表示值或序列;動作分塊預測未來命令的範圍,並選擇它們的執行或組合方式。模型可以使用連續區塊、離散每步令牌或壓縮區塊令牌。

將令牌計數、區塊視野、重疊、時序系綜和遠視界行為作為獨立的實驗變數。否則延遲或成功的變化不能歸因於編碼器。

以五個步驟整理機器人動作詞元化:從連續控制到離散編碼的判讀重點
依正文與一手資料整理的繁體中文實務卡。來源:Physical AI Lab。

預算詞彙和序列長度結合

更多的箱可以減少標量量化誤差,同時增加詞彙量或預測難度。分別編碼每個維度和時間步長可以使動作標記計數乘以維度和視野,減少視覺或語言上下文的空間,增加解碼延遲。

測量端對端提示長度、生成令牌數量、首次動作延遲和控制截止時間。只有當其重建足夠滿足任務需求時,緊湊表示才有用。

理解 FAST 為時間動作壓縮

FAST 論文提出了頻率空間動作序列分詞,並報告了其評估機器人資料集和模型中壓縮和訓練行為的改進。相關的RSS 論文提供了同行評審的方法背景。

FAST 並不等同於動作分塊。它以緊湊的方式編碼序列,而策略仍需對目標機器人進行評估的地平線、解碼器和執行規則。

將規範化繫結到分詞器

許多管道在分組或迴歸前對動作維度進行規範化。每個資料集、每個機器人或全域統計資料會改變令牌邊界和解碼幅度,因此同一令牌辨識符號在沒有統計資料的情況下沒有穩定的物理意義。

使用 交叉身體規範化指南,將共享語意與機器人特有尺度區分開來。用檢查點凍結遮罩、分位數、裁剪策略和逆變換。

明確處理夾爪與混合動作類型

二進位制夾爪命令不應像平滑關節一樣量化。混合動作可以結合類別模式、連續運動和終止訊號,每種訊號都帶有相應語意的丟失和解碼器。

審計稀有模式令牌和衝突展示。經常正確的手臂軌跡配合延遲或反向握把令牌,仍可能在整個操作過程中失敗。

比較合約研究實施

RT-1 在其報告的變換器策略中使用了令牌化的機器人動作, RT-2 則在所研究的視覺-語言-動作設定中以文字令牌表示機器人動作。 OpenVLA 倉庫 記錄了一個獨立的實現和動作-令牌介面。

不要按名稱在系統間傳輸箱數、範圍或解碼假設。檢查已釋出的程式碼和檢查點特定統計資料,然後在本地重現目標動作合約。

測試延遲、飽和度和硬體回放

在部署硬體上進行基準標記化和自迴歸解碼,結合真實上下文長度。在啟用動作前,測量中位數和尾端延遲、錯過控制截止時間、解碼失敗和飽和。

在策略輸出前,在模擬或受保護的硬體模式下重放重建的真值命令。比較連續基線、編碼的真值值和學習到的預測,以確保標記器誤差依然可見。

度規警告反響
覆蓋範圍尾翼和削波率命令飽和改裝範圍
重建物理單位誤差任務尺度漂移調整分箱
序列每個預測時域的詞元數上下文或延遲尖峰壓縮
控制器限額與截止日期事件無效執行固定合約
任務成功與安全邊際代幣評分誤導拒絕釋放

釋出完整的代幣化捆綁包

包含分詞器版本、詞彙表、箱邊或碼本、規範化統計、動作掩碼、單位、影格、控制率、地平線、譯碼器程式碼和校驗和。沒有這些偽影的檢查點不是可復現的機器人策略。

關閉釋出審查,需進行以下檢查。

評估“機器人動作詞元化:從連續控制到離散編碼”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。

只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。

上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。

實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。

把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。

引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。

小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。

所有結論都應能夠追溯到原始記錄,並可複核。

介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。

  • 記錄每一個動作維度和框架。
  • 只針對訓練資料擬合令牌範圍。
  • 報告削波和解碼的物理錯誤。
  • 測量令牌數量和尾部延遲。
  • 在硬體釋出前重放原裝解碼器。

常見問題

離散動作令牌比連續迴歸更好嗎?

兩者都不是普遍的;比較物理重建、策略學習、延遲和任務結果在匹配條件下的情況。

每個動作維度應該使用多少個箱子?

從可接受的物理誤差、觀測覆蓋率和模型容量中選擇,然後按維度和任務區域進行驗證。

FAST 和動作分塊是一樣的嗎?

不。 FAST 壓縮動作序列;分塊定義預測和執行視野。

訓練後可以重新計算分詞器的統計資料嗎?

沒有重新驗證,因為變化的區間或分位數改變了代幣的物理含義,這就不安全了。

用代幣化動作模型應該儲存什麼?

儲存詞彙、邊或碼本、規範化、掩碼、影格和單位約定、地平線、解碼器和校驗和。

動作編碼與重建邊界

動作標記器是機器人控制介面的一部分。透過解碼的物理運動、控制器時序和任務結果來評估,而不僅僅是代幣丟失。