來自人類與影片回饋的機器人獎勵模型

機器人獎勵模型將人類判斷、展示或影片進展轉換為狀態、動作或軌跡段的評分。當手寫獎勵缺少流暢性、關懷、可接受的恢復或指令遵循性等特質時,這種模型非常有用,但學習到的分數仍作為回饋過程的代理。

核心風險在於使用者評審的示例之外的最佳化。模型可以很好地預測長期比較,同時仍然獎勵與標籤資料中偏好片段相關的攝影機捷徑、重複、長軌跡或不安全行為。

將本指南與 人類介入資料指南機器人 VLA 評估指南一起使用。將任務成功、安全約束和獨立的人類判斷排除在獎勵模型之外。

具體定義獎勵模型的預測

選擇輸出代表的是兩兩偏好、標量質量、目標進展、成功機率還是未來事件估計。標註該標籤後方的觀察視窗、動作上下文、預測視野和評估者群體。

不要將舒適度、速度、安全和任務完成合並為一個未公開的評分。當操作員可能在不同部署中以不同方式交換尺寸時,應分別保留尺寸。

宇航員託馬斯·佩斯凱在國際空間站操作觸覺-2 控制裝置
人工評估可能包括工作量、延遲和聯絡資訊,這些是純影片模型可能無法觀察到的;照片無法展示獎勵模型的表現。來源:ESA/NASA 透過維基共享資源。版權: 公有領域, NASA 作品

選擇與問題匹配的回饋格式

成比較較則詢問兩個片段中哪個更好,通常能減少評級者之間的尺度差異。評分表達大小,但需要錨點。進展標籤可以提供時間密度,但假設任務單調地朝目標推進。

成功標籤回答了一個更狹窄的終點問題。從營運決策中選擇格式,記錄平局、糟糕案例和無法判斷結果,而非強制任意獲勝者。

回饋答案實力主要風險
成對哪種更受歡迎簡單相對判斷沒有絕對的質量
分級真棒可用星等雷特尺度漂移
進展更接近球門密集時間訊號非單調任務
成功目標達成終點清晰稀疏狹窄
更正應該改變什麼可操作的上下文教師與控制偏差

寫一個可觀察的標記評分標準

定義任務目標、禁止行為、平滑性或效率標準、平局條件和不可觀察因素。包含目標機器人的正面、負面和邊界示例,而非依賴“良好”或“安全”等詞彙。

影片評定員無法推斷力、轉矩、延遲、攝影機外碰撞或控制器限制是否觸發,除非介面暴露這些證據。應標記缺失資訊,而非讓外觀成為替代。

保留註釋者身份和分歧

按任務和失敗類別衡量評級者間的共識,但不應抹去合理的偏好差異。操作員、安全審查員和終端使用者可能因職責和資訊不同而重視不同的行為。

在每個評判中儲存評級員培訓、評分標準版本、時間戳和信心。重新裁定系統性分歧,報告子群體行為,而不是將所有標籤合並為多數票。

靠近有用邊界的樣本比較

隨機對可能顯而易見,但資訊有限。主動抽樣可以優先處理接近評分、策略分歧、新狀態和高後果失敗,而覆蓋底線則保留共用操作和硬負。

人類偏好強化學習基於兩對軌跡段偏好訓練,並在其評估後的模擬運動和遊戲設定中報告結果。為目標機器人重現回饋迴路,而非將其標籤預算作為通用值轉移。

以五個步驟整理來自人類與影片回饋的機器人獎勵模型的判讀重點
依正文與一手資料整理的繁體中文實務卡。來源:Physical AI Lab。

按軌跡和收藏背景劃分

同一集的相鄰片段共享場景、操作員、物件和結果。如果衍生模型交叉訓練和測試,獎勵模型可能辨識錄製會話,而非學習行為質量。

按源集分組,若宣告要求,則按物件、站點、營運者或策略版本分組。保持與父路徑的增強、裁剪和重疊視窗。

在身體限制內使用影片獎勵

人類影片可以在沒有機器人操作的情況下教授時間程式或物體關係,但形態、視角和動力學各不相同。辨識人手接近物體的功能可能無法正確評分機器人抓握器。

HOLD 論文研究了從人類操作影片和傳遞中獲得的獎勵性學習,並透過其模擬實驗進行。將交叉身體轉移視為假設,驗證機器人特有的觀察、失效和接觸結果。

控制軌跡長度與獎勵聚合

每影格得分加總可能有利於長時間的回合或反覆的視覺獎勵動作。平均值可以掩蓋短暫的嚴重失誤,而僅在終端評分時幾乎無法提供恢復指導。

在策略最佳化前,定義折扣、段重疊、終端處理和失敗懲罰。測試重複、停滯、逆轉進展或提前結束的合成軌跡,以揭示聚合漏洞。

有意識地搜尋獎勵駭客

在模擬或受保護環境中最佳化模型,檢查得分最高的軌跡,而不僅僅是策略成功。生成反例,改變攝影機角度、隱藏物體、重複運動或利用集數邊界,同時使真實目標未被滿足。

ReQueST 論文探討了綜合假設行為,以在其評估環境中尋找有資訊性和不安全的案例。該方法激發了對抗性查詢,但未能確立無關物理機器人的安全性。

僅校正分數以符合宣告的結果

成對偏好對數並不自動錶示成功機率。如果操作需要閾值,則根據可觀測的未完成事件校正相關輸出,並按域報告可靠性、基準率和不確定性。

調整策略後應重新校正,因為最佳化會改變軌跡分佈。基於行為-策略資料的模型,在其幫助建立的新策略上可能不可靠。

分別評估預測、最佳化和人員

第一項指標為比較準確性、排名和校正。第二項指標衡量最佳化得分如何改變任務結果和失敗模式。第三項要求獨立評估者在未看到獎勵分數的情況下判斷結果軌跡。

包括任務成功率、安全事件、介入、時間、精力和子組偏好。學習獎勵較高但獨立結果較差,未能實現部署目標。

度量警告反響
唱片公司協議與未知速率評分標準歧義修訂指導
預測被保留的排名會話快捷方式重組
最佳化比分與結果獎勵駭客增加挑戰
人物盲目判斷Score 不同意拒絕代理
機器人成功與安全僅離線時的增益不要部署

釋出獎勵-資料-策略捆綁包

版本評分標準、註釋協議、回饋資料集、拆分、預處理、獎勵檢查點、聚合、校正、最佳化策略和挑戰集。保留觸發模型或人類分歧的具體示例。

關閉釋出審查,需進行以下檢查。

評估“來自人類與影片回饋的機器人獎勵模型”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。

只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。

上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。

實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。

把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。

引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。

小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。

所有結論都應能夠追溯到原始記錄,並可複核。

介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。

  • 說出判斷和預測的視野。
  • 保留聯絡、未知和註釋者分歧。
  • 按來源、軌跡和上下文劃分。
  • 挑戰獎勵漏洞最佳化策略。
  • 比較獎勵、真實成功、安全感和盲目的人類判斷。

常見問題

獎勵模型和成功探測器是一樣的嗎?

不。成功探測器預測一個明確的結果,而獎勵模型可能代表偏好、進展或質量,而非軌跡。

多少個人類標籤才夠?

沒有普遍計數;使用覆蓋率、一致性、學習曲線和策略挑戰結果來衡量目標分佈。

VLM 分數可以直接作為獎勵使用嗎?

只有在任務特定驗證之後;通用的視覺語言評分可能會錯過接觸、力、時機和安全。

更好的獎勵模式能否取代安全約束?

不。獨立的執行時間約束和風險控制依然必要。

最快的獎勵駭客檢定是什麼?

在沙盒中最佳化分數,檢查得分最高的失敗、重複以及攝影機或集數邊界漏洞。

偏好-訊號與目標-對齊邊界

機器人獎勵模型是記錄回饋過程的學習代理。部署需要獨立的任務、安全和人類判斷證據,最佳化改變了行為分佈。

相關主題:倉儲揀選機器人如何運作?架構、指標與導入判斷