開放詞彙機器人物件指涉定位

開放詞彙機器人目標指代定位將自由形式短語(如盒子後面的藍色杯子)與機器人可追蹤和操作的特定物件連線起來。文字條件檢測使候選名稱的範圍超越固定的訓練分類法,但操作需要幾何和身份,而僅靠 2D 標籤是無法提供的。

可部署的管道保留語言模糊性,提出多種視覺候選,透過掩碼和深度細化例項,透過動作保持 3D 身份,並在動作前立即檢查可達性、姿勢、抓取和禁止區域。

將本指南與 VLA 指南6D 物體姿態指南一起使用。分別報告感知和操控結果。

保持使用者短語及其歧義

解析中心名詞、屬性、關係和請求的動作,但保留原始指令和未解析的引用。規範化不應默默地用假定目標替換旁邊、後方或另一個指令。

當兩個物件仍然合理時,返回候選物件並提出有針對性的澄清。快速任意選擇可能將感知不確定性變成不可逆的操作錯誤。

黃色工業機械臂在工廠工作台上操作圓柱形物體
重複物件使例項身份和空間關係與類別辨識同等重要;照片未展示開放詞彙基礎。來源:KUKA Roboter GmbH,維基共享資源。許可:CC BY 2.0

區分開放詞彙與保證的新穎性

開放詞彙檢測器接受文字類別或引用表示式,超出封閉輸出列表。它們仍繼承了預訓練的概念、偏見和視覺覆蓋,可能在領域特定工具、透明部分或特殊視角上失敗。

OWL-ViT 論文報告了其基準設定中開放詞彙檢測結果。它並不保證對每個未見的工廠物體都能辨識或具物理可操作性。

階段輸出所需證據主要故障
語言短語與關係原始指令含義為“丟失”
檢測候選盒與比分校正覆蓋目標未中
分段例項掩碼邊界與遮擋合併的物件
3D 定位點、姿勢與框架深度與校正錯誤的幾何形狀
行動檢定可達抓取目標新鮮場景狀態不安全接觸

在選擇前先生成候選項

保留帶有文字條件分數、空間證據和明確無匹配結果的頂尖候選項。閾值應根據目標攝影機和物體組合校正,因為分數分佈會在不同場景和短語間變化。

Grounding DINO 是一種開放式檢測器,接受類別名稱或引用表示式,詳見其 官方論文。將其報告的基準測試作為方法證據,而非部署閾值。

給候選物件附加一個例項掩碼

邊界盒可能包含相鄰物件、背景層和多個深度層。遮罩為深度過濾、姿態估計和抓取生成提供了更好的表面集,但其邊緣和遮蔽區域仍然不確定。

Segment Anything 論文描述了可提示的分割和零樣本評估。 SAM 不會辨識使用者意圖的命名物件;探測器、短語和場景邏輯仍然提供該連結。

將畫素投影到時間對齊的 3D 影格中

使用有效的深度、相機內在參數、畸變模型、時間戳和相機到機器人的變換來建立物體點集。拒絕或下重靠近深度不連續點和缺失或多路徑測量的畫素。

從時間 t 和後期移動攝影機影格獲得深度的 2D 遮罩可以建立一個合理但不正確的 3D 目標。在釋出姿勢前,必須強制同步和影格有效性。

以五個步驟整理開放詞彙機器人物件指涉定位的判讀重點
依正文與一手資料整理的繁體中文實務卡。來源:Physical AI Lab。

透過運動保持例項身份

重複的杯子或部件需要穩定的身份,而不是每影格重新選擇得分最高的盒子。將外觀、 3D 位置、運動、物體狀態和遮擋邏輯融合到帶有明確建立、合併、分割和退場規則的軌道中。

機器人或物體運動後,更新軌道並重新定位關係語言。另一個物體的剩餘物件可能不再滿足原始描述。

以機器人為中心的 3D 表示關係

影像的左右取決於攝影機視角。在操作時,使用宣告的世界、底、工具或物件影格和場景允許的公差,分別表達上方、後方、最近和內部。

在關係中保持不確定性和參考物件身份。如果引用是歧義或移動的,僅僅因為一個 2D 排序匹配,目標不能被視為已解析。

檢查語意匹配之外的可操作性

正確命名的物體可能無法到達、過重、附著、過熱、脆弱或處於禁止區域內。定位結果應返回幾何形狀和不確定性,同時由單獨的規劃器和安全層決定是否允許某項操作。

驗證無碰撞方法、抓取面、工具相容性、有效負載、可見度及預期抓取後觀測。不要讓探測器分數覆蓋物理約束。

處理透明、反光和可變形物體

RGB 語言匹配可能定位透明容器,而商品深度則未達到其表面。反射金屬可以產生混合深度,且可變形物體沒有單一剛性姿態。

必要時使用任務特定感知、多視角證據或保守幾何。分別報告這些物件族,而不是將它們平均為共同的不透明物件。

聯絡前立即重新驗證

在初始指令和抓取之間,人員、機器人和物體可能會移動。在接近前和接觸敏感控制開始時,重新整理目標跟蹤、影格變換、可達性、禁止區和抓取間隙。

如果信心下降或身份發生變化,請暫停並提出請求,而不是繼續保持陳舊的姿態。將這種行為與 策略迴避指南聯絡起來。

分層評估管道

測量短語到候選物件的召回率、引用例項準確性、掩碼質量、深度效度、 3D 姿態或點誤差、跟蹤身份切換、澄清成功率、抓取規劃及最終任務結果。包含無匹配和多例項場景。

VoxPoser 在其 報告的實驗中展示了用於機器人操作的語言條件 3D 值對映。新的部署仍需獨立的攝影機、物體、指令和安全評估。

度規硬殼透過問題
語言已解決的參考文獻歧義短語請正確提問
檢測候選項罷免小說同義詞目標保留
遮罩與深度有效目標點遮擋或反射可用幾何
追蹤身份交換重複物件例項穩定
操控安全任務成功移動目標行動已驗證

釋出擱淺合約

版本文書處理器、檢測器、分段器、閾值、深度濾鏡、相機校正、影格變換、跟蹤參數、物件限制和澄清策略。記錄每個候選和決策並帶有時間戳。

關閉釋出審查,需進行以下檢查。

評估“開放詞彙機器人目標指代定位”時,還應儲存模型版本、機器人設定、校正檔案、測試日期和全部試驗記錄。

只有把這些持續投入與單位成功任務的價值比較,才能判斷方案是否適合擴大。

上線後仍要持續檢查分佈變化、感測器漂移、機械磨損和人工接管原因。

實際專案還應指定資料、模型、控制器和安全流程的負責人,並預先定義回復條件。責任邊界、審批記錄與變更紀錄越清楚,故障發生後越容易停止擴散、定位原因並安全恢復。

把任務拆成感知、決策、動作執行和結果確認,可以更準確地定位瓶頸。每一階段都應有獨立指標與失敗示例,避免用端對端成功率掩蓋偶發但嚴重的風險。

引用的產品規格、論文結果和監管要求需要記錄釋出日期與適用版本。資料更新後應重新核對關鍵結論;無法從一手來源確認的內容,應明確標註為待驗證資訊。

小規模試點的價值在於提前暴露介面、人員協作和異常處理問題。試點結束後應依據預設門檻決定擴大、修改或停止,而不是因為已經投入資源就預設繼續。

所有結論都應能夠追溯到原始記錄,並可複核。

介面定義變化時,舊資料和舊控制參數不能在未經驗證的情況下直接複用。

  • 保留原文和未解決的歧義。
  • 保留候選項,結果無匹配。
  • 驗證掩膜、深度和時間匹配的影格。
  • 透過運動保持 3D 例項身份。
  • 在接觸前,請重新檢查可達性、限制和掌握幾何結構。

常見問題

開放詞彙檢測和零發子彈檢測是一樣的嗎?

它們有重疊,但開放詞彙強調文字靈活標籤,而零機會則描述沒有目標類別訓練示例的評估。

我能抓住 CLIP 得分最高的物體嗎?

不。該分數無法確定例項身份、3D 幾何、可達性或抓取安全性。

Segment Anything 會單獨找到一個看不見的有名字物體嗎?

不。它產生可提示的掩體;語言基礎必須辨識代表短語的掩體。

透明物體應該如何處理?

使用適合缺失或不可靠深度的感測器或多視角方法,並保持保守的不確定性。

如果有兩個候選項依然有說服力呢?

提出一個有針對性的澄清,明確控制權,而不是隨意選擇。

語言到可操作例項邊界

開放詞彙基礎擴充了語言介面,而非操作的確定性。機器人必須將詞語連線到一個新鮮、穩定的 3D 例項,並在接觸前重新驗證可操作性。