機器人資料集混合權重決定每個資料集或域提供最佳化樣本的頻率。一個包含 40%儲存影格的集合不一定能獲得 40%的梯度更新,因為取樣器、集數長度、過濾和動作視窗會改變曝光。
一個有用的組合使機器人、任務、現場、操作員、工具和結果的不平衡顯現,然後為宣告的部署目標選擇權重。平均效能不能掩蓋在一個小但安全或關鍵業務領域內的崩潰。
請使用本指南,配合 機器人資料工廠 和 機器人資料質量審計。版本混合規則、實現曝光和評估結果。
區分儲存份額與訓練暴露
取樣器在每一步選擇資料集、片段和時間視窗。過濾、序列長度、分散式工作者和丟棄批次進一步改變實現的暴露。計算計數來自實際訓練迭代器,而不僅僅是目錄。
按領域和時代請求並實現機率紀錄。當檔案缺失、工人不平衡或碎片耗盡時發出警報,默默改變混合情況。

從部署問題定義資料域
域可以是具體體現、任務、場地、操作員、物件族、攝影機設定、控制器版本或結果。單用硬體通常過於粗糙,因為同一臂上的兩個集合在工具、工作單元和指令流程上差異更大。
建立層級標籤,以便分析進行聚合或深入分析。保留未知值,而不是將其分配給方便的多數類。
| 混合規則 | 抽樣機率 | 優勢 | 主要風險 |
|---|---|---|---|
| 比例尺度 | 跟隨儲存計數 | 代表收藏量 | 大域優勢 |
| 域均勻 | 在定義的群組間相等 | 改善小域曝光 | 重複弱資料 |
| 溫度 | 軟化體型不平衡 | 可調折衷 | 敏感指數 |
| 效能最佳化 | 目標驗證目標 | 可以保護弱域 | 過擬合代理集 |
| 預定 | 訓練變革 | 支援課程 | 更難歸屬 |
比較比例取樣、均勻取樣和溫度取樣
大小比例抽樣保持了收藏的普遍性,但可能淹沒小任務。均勻域抽樣保護覆蓋範圍,但可以多次重放一個微小且有雜訊的資料集。溫度取樣透過顯式參數在這些極端之間插值。
執行匹配計算消融,報告獨特資料和重複暴露。在額外更新或不同增強預算下,更優的混合資料並不是一個乾淨的比較。
針對宣告目標最佳化權重
Re-Mix 論文採用分佈穩健最佳化來提升最壞情況下下游域的效能,並報告了對 Open X-Embodiment 衍生混合的效果。文中還描述了其方法中的動作正規化、離散化和早期停止。
將這些發現視為研究證據,而非普遍權重。私有部署可能定義不同領域,且可能對用於選擇混合的小型代理驗證集過擬合。
成功率與失敗多樣性的分離
故障密集資料集可能包含數千個幾乎相同的終端影格,同時缺少不同的前置機制。標記故障類型、起始時間、可恢復性和操作員反應,而非僅加權二元結果。
保持成功的硬負片,但類似失敗。它們防止策略或監控器學習任何罕見的視覺狀態需要停止。

過取樣小域時的帽重複
過度取樣增加曝光,但不增加資訊。跟蹤每個時代的獨特集數、最大重用、近似重複的聚類和標籤不一致。當所有視角都來自同一軌跡時,增強不會產生獨立性。
設定重複次數上限,或者在驗證提升停滯、記憶增長時減少權重。收集新的多樣化例子,而不是無限期重複一個狹窄的來源。
正規化集長貢獻
取樣影格均勻地為長集提供更多更新,而取樣集數均勻地讓每個軌跡初始機率相等。動作塊和時間視窗增加了另一個與長度相關的乘數。
選擇與學習意圖相匹配的單元,並記錄每集的有效視窗。使用 動作分塊指南 來保持地平線和控制率的意義。
保護稀有關鍵領域
有些領域之所以小,是因為事件罕見、昂貴或危險,而不是因為它們不重要。最低取樣底可以保留覆蓋範圍,但標籤薄弱或不切實際的模擬仍可能誤導策略。
應單獨定義臨界域接受度,並要求提供硬體證據。不要用嚴重的迴歸換取全域平均值的微小改善。
衡量平均和最壞域效能
報告每個領域包含樣本數量和不確定性的任務成功率、精度或控制指標。包括宏觀平均、暴露加權平均以及最差領域或低尾部表現,讓讀者看到權衡。
Open X-Embodiment 專案展示了大規模多機器人混合訓練,而任何新混合體仍需自身的機器人、任務和環境。
長時間訓練時監測混合比漂移
碎片可用性、過濾、新增資料和自適應抽樣會隨著時間改變實現的混合。模型還會改變哪些領域較弱,因此有用的課程在預訓練和適應之間可能存在差異。
每個日程轉換和評估檢查點都要更新。當目標是因果診斷時,避免同時調整權重、學習率和資料清理。
在全尺寸執行前使用小範圍消融
訓練更短的匹配計算執行,跨候選權重,尋找效能逆轉、不穩定性和飽和現象。小批次執行無法預測所有縮放效應,但可以拒絕立即抹除關鍵域的混合。
將結果與 機器人 VLA 評估指南 連線,並以硬體試驗結束。儲存種子、樣本痕跡和檢查點選擇規則。
| 審計 | 度量 | 警告 | 反響 |
|---|---|---|---|
| 曝光 | 抽獎與獨特回合 | 請求與實現不同 | 修復取樣器 |
| 複製 | 重複使用與相似性 | 記憶中的微小領域 | 蓋帽還是召回 |
| 長度 | 每集視窗數 | 長時間的試驗占主導 | 換班單元 |
| 效能 | 每個領域及最壞情況 | 普通獸皮塌陷 | 增加地板或配重 |
| 漂移 | 按訓練階段進行暴露 | 未跟蹤時刻表變更 | 版本轉換 |
配合混合規格釋出
記錄領域分類法、資料集版本、抽樣層級、機率、時間表、重複次數限制、集數單元、分割、評估目標和停止條件。與訓練執行一同儲存實現的樣本痕跡。
透過以下清單進行驗證。
評估“機器人資料集混合加權”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。
只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。
上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。
實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。
把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。
引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。
小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。
所有結論都應能夠追溯到原始記錄,並可複核。
介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。
異常測試應覆蓋斷電、通訊丟失、感測器失真、物件滑移和人員進入工作區等情形。系統不僅要發現異常,還應以可預測的方式減速、停止或請求人工確認。
維護計劃需要把檢查週期、易損件、備件、校正和軟體更新納入同一套記錄。若維護成本或停機時間持續上升,應重新評估系統設計,而不是隻提高操作人員負擔。
- 從部署宣告中定義域。
- 測量實際訓練取樣量。
- 封頂重複和審計重複。
- 報告平均和最弱領域結果。
- 版本混合計劃、資料和模型檢查點。
常見問題
比例比例混合是最自然的預設做法嗎?
它是透明的,但大型集合可能會主導並抹除小型部署關鍵域。
一個小資料集應該被過度取樣多少次?
沒有普遍的倍數;設定獨特性、雜音、記憶力和持續進步的上限。
增加更多故障資料會改善恢復嗎?
只有在失效機制、前驅物上下文和恢復標籤有用且正常硬負片仍然存在時才會被使用。
訓練過程中混合重量會變化嗎?
是的,但排程變更和實際曝光必須有版本限制,以確保效果可被理解。
哪種混合比例指標最重要?
使用每個域的效能和宣告的下尾域或關鍵域標準,配合全球平均值。
訓練暴露與最弱域邊界
資料混合是一種最佳化策略,而非資料夾比率。保持每個模型檢查點的實現暴露、唯一性和最弱域結果。