人在迴路的機器人介入資料:記錄、標註與學習

人機介入資料來自自主部署,人員監控行為,在困難或不安全狀態下接管,糾正軌跡,並可能將控制權交還。它不同於從一開始就由人為控制的離線遙操作示教。

其價值在於策略誘導狀態和恢復背景。記錄必須包括接管前的觀察、控制權、人為行為、介入理由、迴歸決策以及後續自主結果,這些都是在同一連續時間線上的。

將本指南與 遙操作資料指南機器人評估指南結合使用。保持職業安全與機器安全控制獨立於學習迴圈。

介入與全面展示分開

展示樣本由人工操作員選擇狀態。介入樣本示例顯示策略在操作員決定需要幫助前存取的狀態。這些分佈支援不同的學習問題,並應帶有不同的標籤。

保留修正前後自主操作。移除它們會使事件變成一個孤立的人力片段,丟失關於接管原因及回傳是否成功的證據。

技術員在 NASA 噴氣推進實驗室監督好奇號測試漫遊車機械臂
人工參與收集需要明確的觀察和介入權威,而僅靠監督並不能證明學習方法的有效性。來源:NASA/JPL-Caltech,維基共享資源。版權: 公有領域, NASA 作品

將控制權定義為狀態機

有用的狀態包括自主、警告、請求接管、人控、請求回交、自主確認和緊急停止。僅靠按鈕邊緣無法顯示機器人是否接受請求或哪個命令到達了致動器。

記錄仲裁輸出和致動器命令,而不僅僅是策略和操作員提案。當網路中斷、死人開關或安全控制器與請求模式衝突時,定義優先順序。

階段必修記錄主要問題失效風險
自治策略觀察與行動是什麼導致了麻煩?缺失的前身
收購請求時間與有效控制時間權限轉移多晚?延遲
更正人類行為與意圖嘗試了哪些回收?模糊標籤
回溯門與州信任策略現在能應付嗎?立即復發
結果任務、安全與介入結果恢復有效嗎?摘材

保留介入前的上下文

在接管前緩衝幾秒或與任務相關的時間視窗,使資料集包含前置提示、策略操作和進度損失。正確的視窗取決於任務動態和動作時域,而非固定的影格數。

儲存同步影片、機器人狀態、指令、強制、模式和事件時間。人工決策可能依賴於模型輸入目前不包含的證據。

衡量決策與系統接管延遲

操作員在介面、網路、仲裁和控制器延遲中感知和決策的時間是分開的。物理機器人在任一間隔內都可以進行較長的移動,從而改變人類實際接收到的狀態。

記錄請求、確認、首次有效人工指令和可測量反應。根據真實的延遲後狀態進行訓練,而不是假設糾正從按下按鈕時就開始。

記錄介入原因和恢復意圖

僅憑動作序列很少能解釋操作者是否預防了碰撞、糾正了對齊、改善抓握或對不確定性作出了反應。使用受控原因分類法,加上可選的註釋和信心。

理由支援過濾和評估,但應與經過驗證的根本原因分開。操作員的判斷可能不完整或不一致。

以五個步驟整理人在迴路的機器人介入資料:記錄、標註與學習的判讀重點
依正文與一手資料整理的繁體中文實務卡。來源:Physical AI Lab。

從介入中學習,但不要複製所有行為

Sirius 專案利用介入訊號在人工迴圈部署框架中重新加權樣本。結果是一種特定的研究方法,包含報告的任務和硬體,而非每個介入影格應獲得最大權重的通用規則。

比較行為克隆、介入加權及其他匹配資料更新情況。人類矯正可能被遙操作介面延遲、次優或受限。

保持線上強化學習的範圍明確

HIL-SERL 專案結合了展示、二元獎勵分類器、線上強化學習和人類介入。其專案頁面描述了隨著策略改進,在報告的操作任務中減少介入。

不要將獎勵示例、示範緩衝區、介入措施和自主經驗合併到一個無標籤資料集中。它們的作用和選擇偏差各不相同。

來自可管理策略狀態的門回交

回交應在機器人穩定、無碰撞且處於策略可處理的狀態分佈範圍內進行。當操作員停止移動時釋放控制,可以在未解決的接觸或對齊不良時恢復自主性。

要求確認並監控第一個自主視野。允許立即重新接管而不丟失過渡歷史。

樣本介入措施而不抹除正常行為

介入視窗罕見且有價值,因此過取樣很常見。過度加權可能導致策略模擬正常狀態下的恢復動作,或過度擬合某操作員的習慣。

使用 資料集混合指南,保留正常的自主、成功恢復和硬負樣本。按階段報告有效暴露情況。

評估介入數量

介入減少意味著更高的自主性,但也意味著操作員更寬容,漏掉危險或任務提前結束。報告自主成功、不安全事件、工作量、決策延遲、糾正時間、複發率和任務質量。

執行固定策略獨立評估,無需隱藏輔助。將收集者的安全支援與策略的自主能力分離。

帶模式疊加的完整回合回顧

同時回放影片、狀態、策略動作、人工操作、有效指揮和權威狀態。檢查邊界對齊情況、丟包情況,以及操作員本打算接管但機器人因其他原因停止的情況。

示例為非介入事件、虛假接管事件以及值得慶祝的恢復事件。維護營運商資料的隱私和員工治理。

度規措施需要分母誤導性的捷徑
介入率操作員工作量所有符合條件的推廣原始計數
接管延遲控制轉移請求事件僅按鍵時間戳
糾正成功立即恢復已完成的介入措施漂亮的片段
複發率回傳質量自治返回第一個安全框架
自主成功策略能力固定方案試驗輔助完成

與介入資料合約一起釋放

檔案權威狀態、觸發策略、延遲、觀察緩衝區、動作通道、原因分類法、回傳門、安全控制、取樣器和評估協議。將每個訓練示例與其原始的持續推廣連結。

透過以下清單進行驗證。

評估“人在迴路的機器人介入資料”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。

只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。

上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。

實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。

把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。

引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。

小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。

所有結論都應能夠追溯到原始記錄,並可複核。

介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。

異常測試應覆蓋斷電、通訊丟失、感測器失真、物件滑移和人員進入工作區等情形。系統不僅要發現異常,還應以可預測的方式減速、停止或請求人工確認。

維護計劃需要把檢查週期、易損件、備件、校正和軟體更新納入同一套記錄。若維護成本或停機時間持續上升,應重新評估系統設計,而不是隻提高操作人員負擔。

報告平均值之外,還應公開最差結果、分佈尾部和失敗影片或紀錄索引。對安全關鍵任務而言,少數嚴重失敗往往比平均效能更能決定是否可以部署。

  • 在接管前記錄自主上下文。
  • 測量有效的控制轉移和物理反應。
  • 儲存糾正的原因、目標和結果。
  • 從可管理的策略狀態進行門禁回傳。
  • 分別評估自主性、安全和學習收益。

常見問題

介入資料和遙操作示教資料是一樣的嗎?

不是。這些資料是在自主執行期間收集的,尤其是在有人決定策略需要修正的州。

只能節省幾秒介入時間嗎?

不。保留前兆、接管、修正、迴歸及後續結果在同一集同步時間線上。

介入次數減少是否代表改善?

不。它要配合固定協議的自主性、安全、工作量和未發生事件指標。

每一個人類行為都應該被視為真實的事實嗎?

不。人工修正可能延遲、介面限制或次優,需要上下文標籤和評估。

什麼時候應該恢復控制權?

只有在顯式門確認策略能夠管理的穩定狀態並確認回傳後。

控制-權限與自主回傳邊界

介入資料既是控制權追蹤,也是訓練樣本。保留導致接管的狀態以及自主迴歸安全的證據。