開放詞彙機器人目標指代定位將自由形式短語(如盒子後面的藍色杯子)與機器人可追蹤和操作的特定物件連線起來。文字條件檢測使候選名稱的範圍超越固定的訓練分類法,但操作需要幾何和身份,而僅靠 2D 標籤是無法提供的。
可部署的管道保留語言模糊性,提出多種視覺候選,透過掩碼和深度細化例項,透過動作保持 3D 身份,並在動作前立即檢查可達性、姿勢、抓取和禁止區域。
將本指南與 VLA 指南 和 6D 物體姿態指南一起使用。分別報告感知和操控結果。
保持使用者短語及其歧義
解析中心名詞、屬性、關係和請求的動作,但保留原始指令和未解析的引用。規範化不應默默地用假定目標替換旁邊、後方或另一個指令。
當兩個物件仍然合理時,返回候選物件並提出有針對性的澄清。快速任意選擇可能將感知不確定性變成不可逆的操作錯誤。

區分開放詞彙與保證的新穎性
開放詞彙檢測器接受文字類別或引用表示式,超出封閉輸出列表。它們仍繼承了預訓練的概念、偏見和視覺覆蓋,可能在領域特定工具、透明部分或特殊視角上失敗。
OWL-ViT 論文報告了其基準設定中開放詞彙檢測結果。它並不保證對每個未見的工廠物體都能辨識或具物理可操作性。
| 階段 | 輸出 | 所需證據 | 主要故障 |
|---|---|---|---|
| 語言 | 短語與關係 | 原始指令 | 含義為“丟失” |
| 檢測 | 候選盒與比分 | 校正覆蓋 | 目標未中 |
| 分段 | 例項掩碼 | 邊界與遮擋 | 合併的物件 |
| 3D 定位 | 點、姿勢與框架 | 深度與校正 | 錯誤的幾何形狀 |
| 行動檢定 | 可達抓取目標 | 新鮮場景狀態 | 不安全接觸 |
在選擇前先生成候選項
保留帶有文字條件分數、空間證據和明確無匹配結果的頂尖候選項。閾值應根據目標攝影機和物體組合校正,因為分數分佈會在不同場景和短語間變化。
Grounding DINO 是一種開放式檢測器,接受類別名稱或引用表示式,詳見其 官方論文。將其報告的基準測試作為方法證據,而非部署閾值。
給候選物件附加一個例項掩碼
邊界盒可能包含相鄰物件、背景層和多個深度層。遮罩為深度過濾、姿態估計和抓取生成提供了更好的表面集,但其邊緣和遮蔽區域仍然不確定。
Segment Anything 論文描述了可提示的分割和零樣本評估。 SAM 不會辨識使用者意圖的命名物件;探測器、短語和場景邏輯仍然提供該連結。
將畫素投影到時間對齊的 3D 影格中
使用有效的深度、相機內在參數、畸變模型、時間戳和相機到機器人的變換來建立物體點集。拒絕或下重靠近深度不連續點和缺失或多路徑測量的畫素。
從時間 t 和後期移動攝影機影格獲得深度的 2D 遮罩可以建立一個合理但不正確的 3D 目標。在釋出姿勢前,必須強制同步和影格有效性。

透過運動保持例項身份
重複的杯子或部件需要穩定的身份,而不是每影格重新選擇得分最高的盒子。將外觀、 3D 位置、運動、物體狀態和遮擋邏輯融合到帶有明確建立、合併、分割和退場規則的軌道中。
機器人或物體運動後,更新軌道並重新定位關係語言。另一個物體的剩餘物件可能不再滿足原始描述。
以機器人為中心的 3D 表示關係
影像的左右取決於攝影機視角。在操作時,使用宣告的世界、底、工具或物件影格和場景允許的公差,分別表達上方、後方、最近和內部。
在關係中保持不確定性和參考物件身份。如果引用是歧義或移動的,僅僅因為一個 2D 排序匹配,目標不能被視為已解析。
檢查語意匹配之外的可操作性
正確命名的物體可能無法到達、過重、附著、過熱、脆弱或處於禁止區域內。定位結果應返回幾何形狀和不確定性,同時由單獨的規劃器和安全層決定是否允許某項操作。
驗證無碰撞方法、抓取面、工具相容性、有效負載、可見度及預期抓取後觀測。不要讓探測器分數覆蓋物理約束。
處理透明、反光和可變形物體
RGB 語言匹配可能定位透明容器,而商品深度則未達到其表面。反射金屬可以產生混合深度,且可變形物體沒有單一剛性姿態。
必要時使用任務特定感知、多視角證據或保守幾何。分別報告這些物件族,而不是將它們平均為共同的不透明物件。
聯絡前立即重新驗證
在初始指令和抓取之間,人員、機器人和物體可能會移動。在接近前和接觸敏感控制開始時,重新整理目標跟蹤、影格變換、可達性、禁止區和抓取間隙。
如果信心下降或身份發生變化,請暫停並提出請求,而不是繼續保持陳舊的姿態。將這種行為與 策略迴避指南聯絡起來。
分層評估管道
測量短語到候選物件的召回率、引用例項準確性、掩碼質量、深度效度、 3D 姿態或點誤差、跟蹤身份切換、澄清成功率、抓取規劃及最終任務結果。包含無匹配和多例項場景。
VoxPoser 在其 報告的實驗中展示了用於機器人操作的語言條件 3D 值對映。新的部署仍需獨立的攝影機、物體、指令和安全評估。
| 層 | 度規 | 硬殼 | 透過問題 |
|---|---|---|---|
| 語言 | 已解決的參考文獻 | 歧義短語 | 請正確提問 |
| 檢測 | 候選項罷免 | 小說同義詞 | 目標保留 |
| 遮罩與深度 | 有效目標點 | 遮擋或反射 | 可用幾何 |
| 追蹤 | 身份交換 | 重複物件 | 例項穩定 |
| 操控 | 安全任務成功 | 移動目標 | 行動已驗證 |
釋出擱淺合約
版本文書處理器、檢測器、分段器、閾值、深度濾鏡、相機校正、影格變換、跟蹤參數、物件限制和澄清策略。記錄每個候選和決策並帶有時間戳。
關閉釋出審查,需進行以下檢查。
評估“開放詞彙機器人目標指代定位”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。
只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。
上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。
實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。
把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。
引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。
小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。
所有結論都應能夠追溯到原始記錄,並可複核。
介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。
- 保留原文和未解決的歧義。
- 保留候選項,結果無匹配。
- 驗證掩膜、深度和時間匹配的影格。
- 透過運動保持 3D 例項身份。
- 在接觸前,請重新檢查可達性、限制和掌握幾何結構。
常見問題
開放詞彙檢測和零發子彈檢測是一樣的嗎?
它們有重疊,但開放詞彙強調文字靈活標籤,而零機會則描述沒有目標類別訓練示例的評估。
我能抓住 CLIP 得分最高的物體嗎?
不。該分數無法確定例項身份、3D 幾何、可達性或抓取安全性。
Segment Anything 會單獨找到一個看不見的有名字物體嗎?
不。它產生可提示的掩體;語言基礎必須辨識代表短語的掩體。
透明物體應該如何處理?
使用適合缺失或不可靠深度的感測器或多視角方法,並保持保守的不確定性。
如果有兩個候選項依然有說服力呢?
提出一個有針對性的澄清,明確控制權,而不是隨意選擇。
語言到可操作例項邊界
開放詞彙基礎擴充了語言介面,而非操作的確定性。機器人必須將詞語連線到一個新鮮、穩定的 3D 例項,並在接觸前重新驗證可操作性。