機器人獎勵模型將人類判斷、展示或影片進展轉換為狀態、動作或軌跡段的評分。當手寫獎勵缺少流暢性、關懷、可接受的恢復或指令遵循性等特質時,這種模型非常有用,但學習到的分數仍作為回饋過程的代理。
核心風險在於使用者評審的示例之外的最佳化。模型可以很好地預測長期比較,同時仍然獎勵與標籤資料中偏好片段相關的攝影機捷徑、重複、長軌跡或不安全行為。
將本指南與 人類介入資料指南 及 機器人 VLA 評估指南一起使用。將任務成功、安全約束和獨立的人類判斷排除在獎勵模型之外。
具體定義獎勵模型的預測
選擇輸出代表的是兩兩偏好、標量質量、目標進展、成功機率還是未來事件估計。標註該標籤後方的觀察視窗、動作上下文、預測視野和評估者群體。
不要將舒適度、速度、安全和任務完成合並為一個未公開的評分。當操作員可能在不同部署中以不同方式交換尺寸時,應分別保留尺寸。

選擇與問題匹配的回饋格式
成比較較則詢問兩個片段中哪個更好,通常能減少評級者之間的尺度差異。評分表達大小,但需要錨點。進展標籤可以提供時間密度,但假設任務單調地朝目標推進。
成功標籤回答了一個更狹窄的終點問題。從營運決策中選擇格式,記錄平局、糟糕案例和無法判斷結果,而非強制任意獲勝者。
| 回饋 | 答案 | 實力 | 主要風險 |
|---|---|---|---|
| 成對 | 哪種更受歡迎 | 簡單相對判斷 | 沒有絕對的質量 |
| 分級 | 真棒 | 可用星等 | 雷特尺度漂移 |
| 進展 | 更接近球門 | 密集時間訊號 | 非單調任務 |
| 成功 | 目標達成 | 終點清晰 | 稀疏狹窄 |
| 更正 | 應該改變什麼 | 可操作的上下文 | 教師與控制偏差 |
寫一個可觀察的標記評分標準
定義任務目標、禁止行為、平滑性或效率標準、平局條件和不可觀察因素。包含目標機器人的正面、負面和邊界示例,而非依賴“良好”或“安全”等詞彙。
影片評定員無法推斷力、轉矩、延遲、攝影機外碰撞或控制器限制是否觸發,除非介面暴露這些證據。應標記缺失資訊,而非讓外觀成為替代。
保留註釋者身份和分歧
按任務和失敗類別衡量評級者間的共識,但不應抹去合理的偏好差異。操作員、安全審查員和終端使用者可能因職責和資訊不同而重視不同的行為。
在每個評判中儲存評級員培訓、評分標準版本、時間戳和信心。重新裁定系統性分歧,報告子群體行為,而不是將所有標籤合並為多數票。
靠近有用邊界的樣本比較
隨機對可能顯而易見,但資訊有限。主動抽樣可以優先處理接近評分、策略分歧、新狀態和高後果失敗,而覆蓋底線則保留共用操作和硬負。
人類偏好強化學習基於兩對軌跡段偏好訓練,並在其評估後的模擬運動和遊戲設定中報告結果。為目標機器人重現回饋迴路,而非將其標籤預算作為通用值轉移。

按軌跡和收藏背景劃分
同一集的相鄰片段共享場景、操作員、物件和結果。如果衍生模型交叉訓練和測試,獎勵模型可能辨識錄製會話,而非學習行為質量。
按源集分組,若宣告要求,則按物件、站點、營運者或策略版本分組。保持與父路徑的增強、裁剪和重疊視窗。
在身體限制內使用影片獎勵
人類影片可以在沒有機器人操作的情況下教授時間程式或物體關係,但形態、視角和動力學各不相同。辨識人手接近物體的功能可能無法正確評分機器人抓握器。
HOLD 論文研究了從人類操作影片和傳遞中獲得的獎勵性學習,並透過其模擬實驗進行。將交叉身體轉移視為假設,驗證機器人特有的觀察、失效和接觸結果。
控制軌跡長度與獎勵聚合
每影格得分加總可能有利於長時間的回合或反覆的視覺獎勵動作。平均值可以掩蓋短暫的嚴重失誤,而僅在終端評分時幾乎無法提供恢復指導。
在策略最佳化前,定義折扣、段重疊、終端處理和失敗懲罰。測試重複、停滯、逆轉進展或提前結束的合成軌跡,以揭示聚合漏洞。
有意識地搜尋獎勵駭客
在模擬或受保護環境中最佳化模型,檢查得分最高的軌跡,而不僅僅是策略成功。生成反例,改變攝影機角度、隱藏物體、重複運動或利用集數邊界,同時使真實目標未被滿足。
ReQueST 論文探討了綜合假設行為,以在其評估環境中尋找有資訊性和不安全的案例。該方法激發了對抗性查詢,但未能確立無關物理機器人的安全性。
僅校正分數以符合宣告的結果
成對偏好對數並不自動錶示成功機率。如果操作需要閾值,則根據可觀測的未完成事件校正相關輸出,並按域報告可靠性、基準率和不確定性。
調整策略後應重新校正,因為最佳化會改變軌跡分佈。基於行為-策略資料的模型,在其幫助建立的新策略上可能不可靠。
分別評估預測、最佳化和人員
第一項指標為比較準確性、排名和校正。第二項指標衡量最佳化得分如何改變任務結果和失敗模式。第三項要求獨立評估者在未看到獎勵分數的情況下判斷結果軌跡。
包括任務成功率、安全事件、介入、時間、精力和子組偏好。學習獎勵較高但獨立結果較差,未能實現部署目標。
| 層 | 度量 | 警告 | 反響 |
|---|---|---|---|
| 唱片公司 | 協議與未知速率 | 評分標準歧義 | 修訂指導 |
| 預測 | 被保留的排名 | 會話快捷方式 | 重組 |
| 最佳化 | 比分與結果 | 獎勵駭客 | 增加挑戰 |
| 人物 | 盲目判斷 | Score 不同意 | 拒絕代理 |
| 機器人 | 成功與安全 | 僅離線時的增益 | 不要部署 |
釋出獎勵-資料-策略捆綁包
版本評分標準、註釋協議、回饋資料集、拆分、預處理、獎勵檢查點、聚合、校正、最佳化策略和挑戰集。保留觸發模型或人類分歧的具體示例。
關閉釋出審查,需進行以下檢查。
評估“來自人類與影片回饋的機器人獎勵模型”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。
只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。
上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。
實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。
把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。
引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。
小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。
所有結論都應能夠追溯到原始記錄,並可複核。
介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。
- 說出判斷和預測的視野。
- 保留聯絡、未知和註釋者分歧。
- 按來源、軌跡和上下文劃分。
- 挑戰獎勵漏洞最佳化策略。
- 比較獎勵、真實成功、安全感和盲目的人類判斷。
常見問題
獎勵模型和成功探測器是一樣的嗎?
不。成功探測器預測一個明確的結果,而獎勵模型可能代表偏好、進展或質量,而非軌跡。
多少個人類標籤才夠?
沒有普遍計數;使用覆蓋率、一致性、學習曲線和策略挑戰結果來衡量目標分佈。
VLM 分數可以直接作為獎勵使用嗎?
只有在任務特定驗證之後;通用的視覺語言評分可能會錯過接觸、力、時機和安全。
更好的獎勵模式能否取代安全約束?
不。獨立的執行時間約束和風險控制依然必要。
最快的獎勵駭客檢定是什麼?
在沙盒中最佳化分數,檢查得分最高的失敗、重複以及攝影機或集數邊界漏洞。
偏好-訊號與目標-對齊邊界
機器人獎勵模型是記錄回饋過程的學習代理。部署需要獨立的任務、安全和人類判斷證據,最佳化改變了行為分佈。