機器人擴散策略:動作去噪與長時域控制

機器人擴散策略透過從雜訊動作序列出發,並基於近期觀測資料迭代去噪來生成動作。學習到的分佈可以代表同一場景的多種合理行為,這在展示中包含真正多模態完成任務的方法時非常有用。

該策略並非整個機器人控制棧。觀測捕獲、正規化、推斷排程、命令轉換、插值、伺服控制、極限和保護反應都圍繞其展開。其預測視野和實際執行的較短部分決定了系統對新證據反應的速度。

本指南應與 機器人動作分塊指南機器人感測器融合指南一起使用。評估目標具體體現和任務分佈的擴散策略,而不是將單一基準改進視為普遍結果。

擴散策略對條件動作分佈進行建模

使用單一回歸目標的行為克隆可以平均不相容的展示,產生不屬於任何已知模式的動作。擴散目標則學習如何將雜訊轉化為與觀察條件一致的動作序列分佈區域。因此,不同樣本可以表達不同的有效模式。

官方的 擴散策略專案 描述了在執行後退視界執行的動作空間中的條件去噪。該方法預測的是序列而非孤立命令,但多模態性並不保證意圖正確:資料集覆蓋率和條件處理仍決定可用的模式。

來自 Open X-Embodiment 的不同機器人例項和操作資料集的馬賽克
跨機體資料集將策略暴露給不同的攝影機、機械臂、夾爪和任務,但每次部署仍需針對具體實體進行評估。來源:Google DeepMind Open X-Embodiment。非程式碼材料許可:CC BY 4.0

訓練增加了噪音,並學會了反向方向

在訓練過程中,在取樣擴散時間步時,會擾動一個乾淨且已展示的動作序列。神經網路接收雜訊序列、時間步和觀測特徵,然後學習一個去噪目標,如新增雜訊或等效參數化。雜訊排程和目校正義必須與推斷時使用的取樣器相匹配。

動作需要一致的單位、排序和正規化。關節位置、笛卡爾δ、旋轉和夾爪命令具有不同的尺度和拓撲結構。旋轉應使用已知不連續的表示,有界抓握器狀態可能需要單獨處理。如果動作介面模糊,模型可以在產生物理不一致命令的同時最小化損失。

推論會逐步細化整段候選動作時域

執行時,策略從雜訊中初始化動作視野,並基於觀測歷史應用有限的反向更新序列。最終序列是樣本,而非確定性最佳化證明。隨機種子、取樣計劃、步驟數和指導選擇都會影響輸出和延遲。

測量從感測器暴露到命令應用的端對端時間。僅 GPU 核心時間就省略了影像傳輸、預處理、佇列和控制器切換。如果一次去噪通道速度低於觀察間隔,陳舊影格或重疊請求需要明確策略,而非無界回呼佇列。

地平線或速率含義主要權衡紀錄
觀測視界過去供應的州情境與記憶最早的資料年齡
預測視野生成的動作相干性與不確定性序列長度
執行視野重新整理前應用的操作效率與反應性應用字首
擴散步驟每個樣本的反向更新質量與延遲取樣器時長
伺服速率硬體命令更新平滑度與頻寬的比較應用時間戳

滾動時域執行形成閉環

常見設計僅執行預測序列的第一部分,再次觀測並生成替換序列。這類似於排程層面上的模型預測後退視界控制,但學習到的生成器不一定線上解決動力學約束的最優控制問題。

從任務速度、接觸敏感度和推論預算中選擇執行字首。長字首保持相干運動並減少計算需求,但對干擾反應緩慢。極短字首經常重新規劃,但可能造成不連續性或暴露取樣變異。分別記錄請求、生成和實際應用的視野。

以五個步驟整理機器人擴散策略:動作去噪與長時域控制的判讀重點
依正文與一手資料整理的繁體中文實務卡。來源:Physical AI Lab。

觀測條件定義了可糾正的誤差

影像、本體感覺、力或語言特徵必須與訓練時完全同步和正規化。相機裁剪、鏡頭、曝光、影格次序和機器人狀態規範都可能改變輸入分佈。看似輕微的尺寸調整或終點影格變化都可能使學習到的對映失效。

使用帶時間戳的歷史記錄,而非假設一批資料同時包含證據。如果視力到達較晚,目前本體感覺與較舊影像結合描述的真實狀態。資料增強可以提高對計劃變異的容忍度,但部署測試仍需具代表性的光照、視角、遮擋和校正偏移。

動作表示與低層控制器的結合

策略可以預測關節目標、笛卡爾δ、速度或正規化的抽象動作。下游控制器將這些值轉換為自身增益、插值和極限下的力矩和運動。因此,重現策略需要動作轉換和控制器設定,而不僅僅是模型檢查點。

將控制細節與 機器人位置、速度和轉矩控制指南ROS 2 即時控制指南進行協調。在行為確定且可測試的層上提供鉗位速率、工作區和力;不要假設訓練示例會強制執行硬體限制。

資料集多樣性不等同於部署覆蓋

Open X-Embodiment 庫將開放機器人資料集統一為統一格式,並區分軟體許可與非程式碼材料許可。大型集合可以拓寬預訓練範圍,但其攝影機幾何體、動作空間、任務標籤和具身組合並不會自動平衡新機器人。

按資料集進行取樣、重複、失效例項和動作轉換的審計。保持部署特定的分割,包含目標抓握器、物件和擾動,但不用於模型選擇。交叉身體預訓練是假設測試,而非校正或運動學差異消失的證據。

評估軸匹配測試偏移檢驗失效證據
物品被保留的例項新形狀與材料錯誤的聯絡
觀點類似訓練的坐騎相機位移視覺錯定位
語言已知的措辭意譯與轉移注意力錯誤的子任務
動力學名義負載質量與摩擦變化超越或下降
時間安排正常計算負載延遲觀測陳舊動作

抽樣變異需要受控評估

由於推斷可能是隨機的,一個起始狀態可能產生不同的序列。在比較軟體變更時固定種子,然後重複多個種子以測量操作變異性。透過可重放的觀測或儀器裝置,將策略隨機性與非受控物體放置和感測器雜訊區分開來。

報告試驗數量、成功定義和置信區間。不要從眾多樣本中選擇最具視覺吸引力的推廣,而不計入被淘汰的嘗試。如果抽樣並排序多個候選序列,排名模型和額外計算是部署系統的一部分,需要各自的消融。

安全不應被納入學習成功指標

任務成功不衡量碰撞能量、關節極限接近度、不安全進入工作空間或人工介入。記錄保護性停止、接觸、峰值力量、掉落物體和操作員接管,即使任務最終完成。近距離事故不應被二元成功標籤隱藏。

使用確定性命令檢查、碰撞監控以及適合應用的合格安全架構。測試影像損壞、延遲狀態、取樣超時、 NaN 輸出和超出範圍的操作。在自主試驗前為每個案例定義備用方案,包括機器人是否保持、撤退或進入安全狀態。

部署審查將模型證據與硬體聯絡起來

擴散策略論文官方實現是該方法和報告實驗的主要參考文獻。複製應包括針碼、檢查點、資料集修訂、取樣器、影像轉換、動作約定和控制器,因為每個都改變可執行策略。

先從離線動作回放開始,接著使用受保護的測試燈具,然後擴充物件、姿態、光照和干擾範圍。每次試驗都保留影片和同步的原始遙測資料。只有當策略的延遲尾隨、故障分類和保護行為符合書面操作範圍時,才推廣。

評估“機器人擴散策略:動作去噪與長時域控制”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。

只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。

上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。

  • 針式觀察和動作約定。
  • 測量完全去噪和指令延遲。
  • 將預測視野與執行字首分開。
  • 在種子和物理變形間反覆試驗。
  • 保持確定論的極限和保護反應獨立。

常見問題

擴散策略是否與願景-語言-行動模型相同?

不。擴散描述了一種動作生成機制。 VLA 策略還會在特定架構中使用語言和願景;它可能使用擴散,也可能不使用。

為什麼要預測動作的順序?

序列可以保持時間相干性,並表示一個簡短的行為段。系統仍只能執行字首,並根據新觀測值進行重規劃。

更多的去噪總是能提升機器人的效能嗎?

不行。額外的步驟會增加延遲,且可能顯示收益遞減。有用的設定必須結合已部署的取樣器、硬體和任務來衡量。

保單能直接控制發動機嗎?

通常,低階別控制器將預測的關節目標或笛卡爾目標轉換為硬體命令。該介面及其限制是系統的一部分。

多模態行為應如何評估?

在種子間重複匹配啟動狀態,統計所有嘗試,檢查模式適宜性,並報告任務、安全和變異指標,而非一次性推出。

擴散策略部署邊界

擴散策略在其訓練分佈下生成學習到的動作序列。它本身並不能保證物理機器人的運動學可行性、控制穩定性、碰撞避免或功能安全。