動作分塊要求機器人策略同時預測多個未來動作,而不是每個查詢只做一個動作。一個連貫的塊減少了長時間操作任務中高層決策的數量,並能保留展示中學到的運動結構。這也帶來了一個新問題:在再次觀察之前,應該信任多少該區塊?
Transformers 動作分塊(ACT)是一種與 ALOHA 一同引入的特定模仿學習方法。 ACT 使用條件變分自編碼器和變換器元件,從影像和機器人狀態預測動作序列。動作分塊是更廣泛的設計模式;並非所有分塊策略都使用 ACT、 CVAE 或相同的時間集合。
將本指南與 擴散策略指南 及 機器人關節控制指南一起使用。將預測的塊、應用於硬體的部分和下一次觀測時間分別視為可測量的獨立量。
動作區塊縮短了有效決策時間
一個持續數千伺服週期的任務,當每個策略查詢預測一個短軌跡段時,需要的高階選擇會更少。段內的動作共享上下文,這可以減少獨立一步預測帶來的抖動,並幫助表示協調的雙手或接觸豐富的運動。
歸約並非自由的。執行區塊內的誤差可能在下一次觀測前累積。因此,分塊將部分問題從每步預測轉向視界選擇和閉環排程。長預測可以作為上下文,而無需機器人以開環方式執行。

ACT 就是一種具體的分塊架構
官方 ALOHA 專案 引入了 ACT 技術,用於預測細粒度雙手操作的動作塊。其策略結合了視覺和本體感覺輸入,配合基於變換器的條件變分自編碼器,在訓練過程中使用潛在變數表示展示變異。
部署時, ACT 通常使用確定性先驗均值,而非請求展示樣式標籤。架構、攝影機編碼器、潛在處理和動作規範化是必須釘頂的實現細節。報告的 ALOHA 任務和資料效率是該設定的證據,而非所有機器人的普遍成功保證。
預測時域、執行時域和查詢時域彼此不同
區塊長度是模型預測的未來動作數量。執行視野是系統替換前傳送的次數,查詢區間是新預測開始的時間。有些實現查詢每個控制步驟並結合重疊;另一些實現執行字首以減少推論負載。
每個視野都用步數和秒數表示。同一 100 步區塊表示 100 Hz 為 1 秒, 10 Hz 為 10 秒。還報告推斷延遲,以及新預測是否與觀測時間或計算結束時間對齊。
| 數量 | 定義 | 太短了 | 太長了 |
|---|---|---|---|
| 預測塊 | 未來產生的行動 | 弱時間背景 | 未來未卜 |
| 執行字首 | 替換前的操作 | 計算與抖動負載 | 緩慢擾動反應 |
| 查詢區間 | 策略請求之間的時間 | 佇列爭用 | 陳舊的計劃 |
| 觀測歷史 | 提供過往證據 | 模糊運動 | 記憶與舊背景 |
| 伺服週期 | 硬體目標更新 | 粗控 | 時序需求 |
時間整合融合重疊的預測結果
在 ACT 論文中,頻繁查詢會產生多個預測,針對同一未來時間步。時間集合將這些重疊估計與偏向近期預測的權重結合起來。這可以在整合新觀測值的同時平滑區塊之間的變化。
平均作用並非總是中立的。笛卡爾旋轉、離散夾爪狀態和多模態替代方案需要在插值有意義的表示中。兩種單獨有效的策略可以平均成一個無效的中間值。記錄貢獻預測和權重,以便區分平滑失敗與模型錯誤。

塊長度遵循任務動態和接觸
自由空間覆蓋可能容忍比插入、抓握閉合或工具接觸更長的字首。根據預期擾動時間、相機影格率、推論尾延遲和底層控制器頻寬選擇動作時域。在階段切換附近縮短重新整理間隔,或允許任務狀態機更改策略排程。
在未完成的試驗中獨立掃描塊和字首。測量完成度、介入、指令不連續性和對移動物體的反應。在靜態展示中得分較高的視界,當接觸時間變化時可能失敗,因為策略在物理事件轉移後仍會持續記憶的片段。
展示需要時間上的對齊和多樣性
遙操作紀錄將人類意圖、攝影機影格、機器人狀態和指令操作耦合。這些流之間的延遲可能會使策略反應遲到。保留原始時間戳,估算遙操作延遲,並定義動作標籤是否代表期望或應用的機器人狀態。根據檔案規則,僅移除損壞樣本。
收集物體姿態、接近、糾正和恢復的變化,而不僅僅是乾淨的名義成功。學習者無法推斷如何從展示中缺失的狀態恢復。平衡重複任務和運算子,避免最大會話占主導地位,並在分拆訓練和評估資料時保持連續的事件。
低階別控制器負責塑造每個區塊
預測的關節目標會透過插值、增益、轉矩和運動限制。如果訓練機器人使用不同的控制器速率或阻抗,同一數值塊可能會產生不同的物理路徑。保留控制器設定和測量應用時間戳與模型偽裝。
與 機器人關節增益調節導引 和 碰撞檢測導軌進行座標限制和跟蹤檢查。塊是一個學習的參考序列,而非經過認證的運動原語。伺服層必須可預測地拒絕不可能或陳舊的指令。
| 失效模式 | 可觀察的症狀 | 隔離測試 | 緩解措施 |
|---|---|---|---|
| 陳舊的觀察 | 糾正行動太晚了 | 新增受控延遲 | 縮短字首或排程 |
| 區塊邊界跳躍 | 命令不連續性 | 重疊目標的劇情 | 集合規則或過渡規則 |
| 控制器不匹配 | 追蹤與聯絡變更 | 重複同樣的目標 | 匹配介面與增益 |
| 模平均 | 無效中間動作 | 檢查貢獻者 | 結構化輸出或選擇 |
| 缺失的恢復資料 | 複合漂移 | 任務中擾動 | 新增糾正示範 |
閉環擾動測試揭示了陳舊行為
在策略生成塊後移動物體,調整抓取時機,新增一個小的順應偏轉,或暫時遮擋攝影機。測量機器人移動了多少毫秒,以及在應用動作發生變化之前的移動量。這比說系統頻繁重新規劃更有資訊量。
測試推論超載和丟棄的觀察值。決定是完成目前字首、保留最後一個有界目標還是停止。排隊舊塊通常很危險,因為每個塊都基於過時狀態。使用序列辨識符號證明是哪個觀察產生了每個應用命令。
評估需要進展和失敗分類法
二元任務成功隱藏了策略在放置過程中是否達到、被抓取、解除或失敗。定義可觀察的里程碑,分類感知、錯誤物體、軌跡、接觸、滑倒、暫停和保護性停止失敗。即使操作員挽救了試驗,也將人工介入計為結果。
報告匹配和偏移條件的試驗計數和置信區間。在不同策略版本中重複相同的初始設定,並隨機執行順序以減少預熱或操作員偏差。影片對複核非常有用,但需要同步的指令、狀態和事件紀錄來測量延遲和邊界行為。
複製是完整的執行合約的固定方式
ALOHA 倉庫提供與專案相關的硬體和學習程式碼。有效的複製品仍記錄倉庫的修訂、資料集、攝影機轉換、策略速率、區塊大小、時間集合設定、動作單元和機器人控制器。
透過離線回放、受保護的硬體試驗和逐步調整的測試來推動設定。保持固定的任務開始和干擾迴歸集。如果新塊大小提升了平均完成度,但增加了碰撞或介入尾部,說明該變更並未帶來整體更好的部署。
評估“機器人動作分塊: ACT、時間整合與閉環執行”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。
只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。
上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。
- 區分動作分塊與 ACT 架構。
- 記錄預測、執行和查詢時間。
- 對應展示與物理時間戳對齊。
- 測試重疊、陳舊的觀察和推論超載。
- 報告里程碑、介入措施和不確定性。
常見問題
ACT 和所有行動分塊策略一樣嗎?
不。 ACT 是一種特殊的 CVAE 和變換器模仿學習方法。其他架構也可以預測和執行動作塊。
機器人應該執行整個預測的片段嗎?
不一定。許多系統在區塊結束前會再次查詢,或結合重疊的預測。安全的選擇取決於延遲、任務動態和干擾。
時間集合是做什麼的?
它結合了針對同一時間步長的多個預測,通常對較新的預測加權更強。它可以平滑更新,但也能平均不相容模式。
動作分塊和軌跡規劃有何不同?
學習到的塊可以從資料中預測動作。運動規劃器通常在顯式的運動學或碰撞模型中進行搜尋。這兩種模型都可能提供對控制器的引用,但它們的保證不同。
最重要的部署紀錄是什麼?
觀察捕獲、推斷開始和結束、預測序列、應用命令和機器人狀態都集中在同一時間基。該紀錄暴露了陳舊和邊界誤差。
動作分塊控制邊界
動作區塊是與機器人介面、控制器和資料分發繫結的學習指令序列。驗證整個物理系統的時序、可行性、接觸行為和保護反應。