機器人資料集版本控制為資料狀態賦予不可變身份,並記錄原始回合如何成為標籤、轉換檔案、分割、統計和訓練輸入。 Lineage 透過程式碼、環境、模型工件、評估和部署將這一鏈條延伸。
僅靠日期和資料夾名稱是不夠的。機器人資料依賴於工具、校正、韌體、控制器、現場和操作員的環境,修正後的標籤會影響許多模型。系統必須支援複製、衝擊分析和相容的回復。
結合資料 質量審計 和 LeRobotDataset v3 指南,使用本指南。保持原始捕獲不變,並作為新的派生版本建立修正。
使用不可變的內容身份
為原始檔案、清單和派生資料集分配雜湊或不可變物件辨識符號。友好的語意版本可以描述意圖,而內容身份則證明使用了哪些位元組和記錄。
編輯標籤或替換相機檔案後,不要重複使用辨識符號。建立一個新版本,引用父檔案及其更改原因。

原始捕獲只保留附加
原始感測器和指令資料是證據。當時間戳、標籤或校正關聯錯誤時,保留原始源,並建立校正層或新的派生偽影。
根據權利和隱私要求控制存取和儲存。不可篡改性並不意味著每個人都能讀取敏感的原始資料。
| 譜系物件 | 不可變的恆等式 | 必修父母 | 變化創造了 |
|---|---|---|---|
| 原始回合 | 捕獲校驗和 | 裝置與會話 | 新一輪捕獲 |
| 唱片公司 | 註釋顯現雜湊 | 病歷與分類學 | 新廠牌版本 |
| 變換輸出 | 工件與程式碼雜湊 | 輸入、程式碼、參數 | 新衍生版本 |
| 分裂 | 成員清單雜湊 | 資料集版本 | 新分割版本 |
| 模型 | 工件雜湊 | 資料、程式碼、設定、環境 | 新型號版本 |
建立完整的回合清單
清單應命名事件、感測器、動作、時間戳、任務、結果、機器人、工具、校正、韌體、軟體、操作員或收集模式、權利和質量狀態。儲存校驗和和位置時,不將儲存路徑作為身份。
自動驗證引用完整性和必需欄位。保持未知值顯式,這樣下游過濾器不會將缺失的後設資料視為有效預設值。
包含物理設定沿襲
機器人資料語意會隨著工具中心點、關節零點、夾持指、攝影機外部元件、有效負載和控制韌體而變化。將這些版本關聯到每個會話,並將會話中的變化記錄為新段。
軟體提交無法重建磨損的杯子、移動的攝影機或更換末端效應器。應保留維護和校正證據,同時保留數字設定。
將變換表示為有向圖
每個轉換記錄輸入身份、程式碼修訂、依賴環境、參數、執行時和輸出身份。示例包括同步、過濾、影像調整、動作正規化、註釋合併和格式遷移。
有向無環圖使扇入和扇出變得可見:一個模型可以使用多個資料集,而一個修正後的事件則可能影響多個混合和釋放。

驗證模式遷移和語意保持
遷移可以成功寫入新檔案,同時更改聯合順序、單元、集數邊界或缺失值含義。在接受派生版本前,先執行模式檢查並重放代表性集數。
當變形對映機器人特定動作時 ,使用跨身體動作指南。保留可逆測試和遷移報告。
版本列車驗證與測試成員資格
分割是一種一級產物,包含成員規則和不可變的 ID。新資料不應默然重排歷史測試集或將衍生的兄弟節點跨分割槽移動。
每次執行都連結到一個精確的分割版本。如果評估宣告從新集數變為新站點或機器人,請建立新的分割,而不是重新命名舊結果。
將統計資料和詞彙繫結到資料集
正規化統計、令牌詞彙、任務對映和類權重均來自特定資料集和拆分版本。過濾或單位變更後重複使用陳舊統計資料可能會破壞訓練,而檔案仍在載入。
記錄計算程式碼和成員身份。僅將學習預處理擬合於訓練資料,並將其身份與模型釋出。
連結訓練執行與環境
捕獲資料並拆分身份、混合設定、程式碼提交、容器或依賴鎖、硬體、種子、模型設定、檢查點選擇和指標。目前 MLflow 資料集跟蹤檔案 僅為工具參考,而非完整的機器人專用血統設計。
執行跟蹤系統只有在輸入正確且不可變時才有用。確認記錄的資料集名稱是否解析為精確的清單,而非可變的別名。
釋出具有持久修訂記錄的資料集
Hugging Face 資料集上傳檔案解釋了目前 Hub 釋出的工作流程。倉庫提交可以提供有用的修訂身份,而資料集卡片、授權條款和外部工件雜湊仍需維護。
DVC 或物件儲存清單可以管理大型偽影。除非工作流提供校正、權限、標籤意向或物理設定,否則沒有工具能自動捕捉這些資訊。
演習影響分析與回復
選擇已更正或撤回的節目,找到所有消耗該集的衍生資料集、統計資料、執行、模型和部署。然後選擇已部署的模型,重建其來源和評估包。
回復必須恢復相容的模型、預處理、模式、動作適配器和設定。僅僅恢復一個檢查點以對應變動的統計資料,並不構成有效的回復。
| 血統測試 | 起點 | 期望跡 | 發現故障 |
|---|---|---|---|
| 繁殖 | 模型釋出 | 精確執行與遺蹟 | 可變別名 |
| 源痕跡 | 培訓班 | 原始回合與變身 | 失蹤的父母 |
| 影響 | 更正的回合 | 所有受影響的型號 | 孤兒消費者 |
| 權利 | 撤回的來源 | 已發表的衍生產品 | 未追蹤副本 |
| 回復 | 部署 | 相容全捆 | 模式不匹配 |
釋出時附有血統接受清單
檔案辨識符號規則、保留、清單模式、轉換圖、分割治理、執行跟蹤、存取控制、權限和回復過程。定期測試圖,而不是信任連結的存在。
透過以下清單進行驗證。
評估“機器人資料集版本與資料血緣”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。
只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。
上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。
實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。
把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。
引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。
小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。
所有結論都應能夠追溯到原始記錄,並可複核。
介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。
異常測試應覆蓋斷電、通訊丟失、感測器失真、物件滑移和人員進入工作區等情形。系統不僅要發現異常,還應以可預測的方式減速、停止或請求人工確認。
維護計劃需要把檢查週期、易損件、備件、校正和軟體更新納入同一套記錄。若維護成本或停機時間持續上升,應重新評估系統設計,而不是隻提高操作人員負擔。
- 保持原始證據不可篡改,修正版本管理。
- 將物理設定和校正與會話關聯。
- 版本轉換、拆分、統計和詞彙。
- 將每個模型繫結到精確的資料和環境偽影上。
- 測試重現、雙向衝擊分析和回復。
常見問題
帶有日期戳的資料集資料夾是否足夠用於版本管理?
不。日期不能證明內容身份、父版本、轉換程式碼或資料劃分歸屬。
錯誤的原始標籤是否應該被編輯?
保留原始證據,並建立新的更正標籤或帶有來源的衍生資料集版本。
檢查點中的資料集名稱夠用嗎?
不。儲存不可變的清單、分割、混合、統計、程式碼和環境身份。
Hugging Face、 DVC 或 MLflow 會自動完成血統嗎?
不。它們提供了有用的原語,但機器人後設資料、校正、權利和語意轉換必須被有意捕獲。
血統應如何檢驗?
將模型追溯到原始回合、受影響部署的原始碼變更以及透過完全相容的回復釋出。
不可變源邊界與可重現模型邊界
血統是操作證據,而非命名規範。釋出必須可從不可變源重現,並且可作為相容的資料-模型-系統捆綁包可逆。