機器人視覺-語言-動作策略將視覺觀察和語言指令對映為動作,但評估則觀察整個部署鏈。攝影機、提示處理、策略推斷、動作轉換、控制器、夾爪和環境均對結果有貢獻。僅憑成功率無法確定哪些能力有效或失敗。
一個有用的協議會凍結設定,定義任務和初始狀態,分層熟悉和變化的條件,記錄試驗層面的結果並報告不確定性。它還測量了延遲、介入和物理副作用。這使得不同模型版本的結果可比,而不會將研究基準變成毫無依據的安全性宣告。
本指南應與 擴散策略指南 及 動作分塊指南結合使用。在將所有結果歸因於單一模型標籤之前,分別評估語言基礎、感知、動作生成和執行。
測試前凍結系統身份
記錄模型架構、檢查點雜湊、標記器、提示模板、影像預處理、策略取樣設定和動作規範化。還記錄機器人序列設定、攝影機內在和外部、工具、有效負載、控制器增益、韌體和軟體版本。當多個相關元件發生變化且未註明歸因時,模型比較無效。
定義預熱、重置和校正程式。引腳推斷硬體和電源模式,因為延遲會影響行為。儲存環境資產和物件辨識符號,而不僅僅是通用類別。如果線上適配、檢索或記憶體處於啟用狀態,保留初始狀態並為每次試驗更新歷史。

任務需要可觀察的開始和結束狀態
寫下每條指令、允許的釋義、初始物件區域、機器人起始姿勢、超時和成功謂詞。用可測量狀態替代諸如外觀正確等判斷:物體在標記區域內,抽屜開啟超過距離或工具保留一段時間。在觀察結果前定義部分進展里程碑。
明確策略可能使用的內容。隱藏的人工糾正、手動提示重寫或特權物件姿態會改變任務。計數重試次數和澄清請求。如果評估者能阻止不安全的動作,應將介入作為結果記錄,而非刪除試驗。
| 評估層 | 問題 | 度規 | 失效示例 |
|---|---|---|---|
| 語言 | 指令是接地的嗎? | 物件與關係選擇 | 錯誤的物體 |
| 認知 | 場景有被呈現嗎? | 姿勢或州里程碑 | 遮擋誤差 |
| 規劃或策略 | 進展是連貫的嗎? | 賽段完工 | 錯誤的順序 |
| 控制 | 指令會被追蹤嗎? | 誤差與飽和 | 超速 |
| 安全行為 | 界限被尊重了嗎? | 介入與接觸 | 保護性止擋 |
分層熟悉且變化的條件
將類似訓練的組合與新的物件例項、姿勢、背景、視角、光照和語言區分開來。合成測試可以重新組合熟悉的名詞、關係和動作,而較難的測試則引入訓練中缺少的概念。將預期的轉變標記為標籤,而不是將每個困難的試煉歸為泛化。
在每個層內使用足夠的重複次數,並隨機化執行順序。否則,一個簡單的物件或一個有利的攝像角度可能會主導聚合。保留一個固定的迴歸集用於版本比較,一個隱藏集用於模型選擇洩漏控制。
語言基礎需要受控的比較
測試保留意義的釋義,然後進行最小對立樣本,改變一個物件、屬性、空間關係或動作。新增無關用詞和合理的干擾物件。僅因場景中只存在一個可理解物件而成功的策略,並未證明基於語言的選擇。
包含當目標模糊或不可得時,應觸發澄清、拒絕或不採取行動的指令。評分機器人是否避免基於無依無據的猜測行動。保持語言測試在場景中具有文化和物理上的可解讀性;僅憑語言新穎不應默默影響任務的可行性。

進展指標使得稀疏的成功變得可診斷
將操作拆分為多個階段,如接近、首次接觸、穩固抓握、升力、運輸和放置。記錄最遠有效階段、每個階段的時間以及進展是否後來被撤銷。連續距離可以補充里程碑,但不應取代任務語意。
使用測試前約定的失敗分類法:錯誤目標、錯抓、碰撞、滑動、策略停滯、超時、控制器限制、感知損失和評估者介入。對模型版本盲目審查模糊影片。報告任務級和失敗級計數,以確保改進有機制。
| 狀況 | 最低報告 | 不確定性 | 物理側度量 |
|---|---|---|---|
| 匹配任務 | 成功計數與試驗 | 二項區間 | 接觸與介入 |
| 新穎的物品 | 每個物件的結果 | 分層區間 | 掉落或損傷 |
| 語言轉變 | 每個模板的結果 | 按任務分組 | 誤向物體運動 |
| 視角轉移 | 姿態與光線層 | 跨場景傳播 | 工作空間遊覽 |
| 潛伏應力 | 延遲分佈 | 百分位區間 | 停滯指令旅行 |
試驗計數防止錯誤精度
十次試驗中十次成功並不證明 100%的成功機率。報告分子、分母及合適的二項信心分數或可信區間。當重複試驗共享同一物體或場景時,觀察結果會被聚類;展示每個目標的結果,而不是假裝每次嘗試都是獨立的。
圍繞操作上重要的差異來規劃樣本量。停止規則和排除試驗必須提前制定。如果計算極限要求樣本較小,將結果描述為初步,保留原始結果。小數點越多,證據越多。
延遲和資料年齡應列入記分卡
時間戳攝影機曝光、狀態取樣、推斷佇列、模型完成、命令轉換和致動器應用。報告中位數和尾端延遲,以及每次觀測動作到達機器人時的年齡。平均模型吞吐量可與罕見的物理失效停滯共存。
使用 ROS 2 即時控制指南 將推論排程與有界硬體迴圈區分開來。注入受控延遲和丟影格,然後測量過時命令的行程和備用行為。系統應暴露不確定性或停止,而不是默默執行舊計劃。
介入措施和副作用即為結果
統計緊急停止、保護性停止、操作員接管、手動物體重置、碰撞、墜落以及力或轉矩極限事件。救援試驗不等同於自主成功。即使最終物體狀態滿足任務條件,也報告近距離錯過和工作空間違規。
將接觸證據與 機器人碰撞檢測指南協調。能力評估不確定功能安全。保護功能、風險評估和驗證仍是機器人標準和應用要求下的獨立工程活動。
通用策略案例必須嚴格限定結論範圍
Octo 專案描述了一種基於變換器的擴散策略,預訓練於大量開放 X-Embodiment 資料混合上,並在多個真實機器人設定中進行評估。這是跨實體策略工作的有用範例,但其結果仍針對報告的任務、機器人和評估程式特有。
官方的 Octo 倉庫記錄了實現和許可細節。在適應此類模型時,請記錄觀察和動作適配器、微調資料及控制器差異。不要將紙質平均值轉給未經測試的機器人,也不要將通用策略描述為通用。
釋出可審計的結果包
釋出任務定義、設定清單、每次試驗結果、種子、時間戳、評估者規則和失敗標籤。在隱私和權利允許的情況下保留同步的影片和遙測資料。聚合表應可透過版本管理指令碼從試驗層級資料中復現。
Octo 論文和Open X-Embodiment 庫為一個通才策略生態系統提供了主要背景。引用精確的修訂,並將來源宣告與測量區分開。透明的負面結果比無法解釋的成功率更有價值。
評估“機器人 VLA 評估:任務、泛化、延遲與安全證據”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。
只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。
上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。
- 凍結模型、提示詞、機器人和控制器身份。
- 定義可衡量的任務和部分進展。
- 分層匹配、組合和轉移案例。
- 報告數量、不確定性、延遲和資料老化。
- 統計介入措施和身體副作用。
常見問題
VLA 在機器人學中是什麼意思?
它通常指的是一種視覺-語言-動作模型,透過視覺觀察和語言來條件機器人行動。架構和動作介面不同,因此僅標籤本身並不構成規範。
任務成功率足以比較兩項策略嗎?
不需要。包括試驗次數、不確定性、任務層級、進展、延遲、介入和失敗。否則,同樣的百分比可以描述非常不同的系統。
泛化應如何檢驗?
命名變換,如新物件、姿勢、視角、措辭或組合,並分別報告每個層級,與訓練類條件分開報告。
一次人類救援應該算作成功嗎?
不。分別記錄自主結果和介入。挽救完成可以作為有用的診斷證據,但不等同於自主成功。
高 VLA 分能證明機器人安全嗎?
不。能力基準不能取代危害分析、保護功能、安全驗證或應用特定操作限制。
VLA 評估結論邊界
VLA 評估結果適用於已記錄的模型、機器人、控制器、任務分配和測試程式。它們不應推廣到未經測試的環境,也不應作為安全認證使用。