オープン語彙ロボットのオブジェクトグラウンディングは、箱の後ろにある青いカップのような自由形式のフレーズを、ロボットが追跡・操作できる特定のオブジェクトに結びつけます。テキスト条件付き検出は候補名を固定された訓練分類法を超えて広げますが、操作には2Dラベルだけでは提供できない幾何学的および同一性が必要です。
展開可能なパイプラインは言語的な曖昧さを保持し、複数の視覚的候補を提案し、マスクや奥行きでインスタンスを精緻化し、動きを通じて3Dアイデンティティを維持し、到達可能性、ポーズ、把握、禁止領域を動作直前にチェックします。
このガイドを VLA ガイド や 6Dオブジェクトポーズガイドと一緒に使ってください。知覚と操作の結果は別々に報告してください。
ユーザーフレーズとその曖昧さを保持する
ヘッド名詞、属性、関係、要求されたアクションを解析しつつ、元の命令と未解決の参照は保持します。正規化は、隣や後ろ、あるいはもう一方のものを仮定された目標に静かに置き換えるべきではありません。
2つの対象が妥当な場合は、候補を返し、ターゲットを絞った明確な説明を求めてください。素早い任意の選択は、知覚の不確実性を不可逆的な操作エラーに変えてしまうことがあります。

オープン語彙と保証された新規性を区別する
オープン語彙検出器は、閉じた出力リストを超えたテキストカテゴリや参照表現を受け入れます。彼らは依然として事前訓練から受け継がれた概念やバイアス、視覚的カバレッジを受け継ぎ、ドメイン固有のツールや透明な部分、珍しい視点で失敗することもあります。
OWL-ViTの論文は、ベンチマーク設定におけるオープン語彙検出の結果を報告しています。それは、見えない工場のオブジェクトすべてに対して認識や物理的な実用性を保証するものではありません。
| 舞台 | 出力 | 必要な証拠 | 主な故障 |
|---|---|---|---|
| 言語 | 表現と関係 | 元の指示 | 失われたという意味 |
| 検出 | 候補ボックスとスコア | 校正されたカバレッジ | 目標は外れました |
| セグメンテーション | インスタンスマスク | 境界と閉塞 | 統合されたオブジェクト |
| 3Dグラウンディング | ポイント、ポーズ、フレーム | 深度と校正 | 間違ったジオメトリ |
| アクションチェック | 到達可能な把握目標 | 新鮮なシーン状態 | 危険な接触 |
対象を選ぶ前に視覚候補を生成する
テキスト条件付きスコア、空間的証拠、明確なマッチなし結果を持つトップ候補を保持してください。スコア分布はシーンやフレーズによって変動するため、ターゲットカメラとオブジェクトミックスで閾値をキャリブレーションする必要があります。
グラウンディングDINOは 、公式論文で説明されているように、カテゴリ名や参照式を受け入れるオープンセット検出器です。報告されたベンチマークを導入の閾値ではなく、方法の証拠として使用してください。
候補にインスタンスマスクを付けます
バウンディングボックスには隣接するオブジェクト、背景レイヤー、複数の奥深レイヤーが含まれることがあります。マスクは深度フィルタリング、ポーズ推定、グラス生成のためのより良い表面セットを提供しますが、そのエッジや遮蔽領域は依然として不確実です。
Segment Anythingの論文では、プロンプト可能なセグメンテーションとゼロショット評価について説明しています。SAMはユーザーが意図した名前付きオブジェクトを特定しません。検出器、フレーズ、シーンロジックがそのリンクを依然として提供しています。
ピクセルを時間に合わせて3Dフレームに投影します
有効な深度、カメラの内在要素、歪みモデル、タイムスタンプ、カメラからロボットへの変換を用いてオブジェクトポイントセットを作成します。深度の不連続点や欠損・多経路測定付近のピクセルを排除またはダウンウェイトします。
時間tからの2Dマスクと後の移動カメラフレームからの深度を組み合わせることで、妥当ながらも誤った3Dターゲットを作成できます。ポーズを公開する前に同期とフレームの有効性を強制してください。

動きを通じてインスタンスのアイデンティティを維持する
繰り返しのカップやパーツは安定した識別子を必要とし、毎フレーム最高得点のボックスを再選び直す必要はありません。外観、3D位置、モーション、オブジェクト状態、遮蔽ロジックをトラックに融合させ、明示的な作成、マージ、分割、退職ルールを設けます。
ロボットやオブジェクトの動きの後、トラックを更新し、関係言語を再グラウンディングします。他の物体の残骸は元の説明をもはや満たさなくなることがあります。
ロボット中心の3Dで関係を表現する
左右の画像はカメラの視点によって異なります。操作には、宣言されたワールド、ベース、ツール、オブジェクトのフレームとシーンに適した許容範囲を使い、上、後ろ、最近、内側を表現します。
関係内に不確実性と参照対象同一性を保持してください。参照が曖昧または移動的であれば、単一の2次元順序が一致しているからといって目標を解決したとはみなされません。
セマンティックマッチを超えた実行可能性をチェック
正しく名前が付けられた物体は、到達不可能、重すぎ、接続されている、熱い、壊れやすい、または禁止区域内にある場合があります。グラウンディングは幾何学と不確実性を返し、別のプランナーと安全レイヤーが動作の許可を決定します。
衝突のないアプローチ、グリップ面、ツール互換性、ペイロード、視界、そして期待されるグラップ後の観測を検証します。検出器スコアが物理的制約を上書きさせてはいけません。
透明で反射性があり変形可能な物体を扱う
RGB言語のマッチングにより、商品の深さが表面を外す際に透明なコンテナを特定できます。反射金属は混合的な深さを生み出すことができ、変形可能な物体は一つの剛体姿勢を持ちません。
必要に応じて、タスク固有のセンシング、マルチビューエビデンス、または保守的な幾何学を活用しましょう。これらのオブジェクトファミリーを共通の不透明オブジェクトに平均化するのではなく、別々に報告してください。
接触直前に再確認する
最初の指示から掴みまでの間に、人間やロボット、物体が動くことがあります。目標の追跡、フレーム変換、到達可能性、禁止区域、グリップクリアランスを接近直前および接触感応制御開始時に更新します。
自信が落ちたりアイデンティティが変わったら、停滞したポーズから続けるのではなく、一旦立ち止まって尋ねてみてください。この行動を ポリシー・アブステンション・ガイドに結びつけてください。
パイプラインを層ごとに評価する
フレーズから候補への想起、参照インスタンスの精度、マスク品質、深度妥当性、3Dポーズまたはポイント誤差、識別子切り替えの追跡、明確化の成功、把持計画、最終課題の結果を測定します。ノーマッチシーンやマルチインスタンスシーンも含めてください。
VoxPoserは 報告された実験で、ロボット操作のための言語条件付き3D値マップを実証しています。新たな展開には独立したカメラ、オブジェクト、指示、安全評価が必要です。
| 層 | メートル法 | ハードケース | 合格に関する質問 |
|---|---|---|---|
| 言語 | 解決された参考文献 | 曖昧な表現 | 正しく質問してください |
| 検出 | 候補リコール | 小説の同義語 | ターゲット保持 |
| マスクと深度 | 有効なターゲットポイント | 遮蔽または反射 | 利用可能なジオメトリ |
| 追跡 | 識別スイッチ | 繰り返し対象 | インスタンス安定 |
| 操作 | 安全なタスク成功 | 標的を移動させた | 行動が確認されました |
地上契約を解除する
バージョンテキストプロセッサ、検出器、セグメント、閾値、深度フィルター、カメラキャリブレーション、フレーム変換、トラッキングパラメータ、オブジェクト制限、明確化ポリシー。すべての候補と決定をタイムスタンプ付きで記録してください。
以下のチェックを伴ったクローズリリースレビュー。
- 元のフレーズと未解決の曖昧さを保持してください。
- 候補を残し、マッチングなしの結果を出す。
- マスク、深度、時間に合わせたフレームを検証します。
- 動きを通じて3Dインスタンスのアイデンティティを維持しましょう。
- 連絡する前に、到達可能性、制限、そして幾何学的把握を再確認してください。
よくある質問
オープン語彙検出はゼロショット検出と同じですか?
両者は重複していますが、オープン語彙はテキストフレキシブルラベルを重視し、ゼロショットはターゲットクラスの訓練例なしの評価を指します。
CLIPスコアが最も高い物体を掴んでもいいですか?
いいえ。スコアはインスタンスのアイデンティティ、3Dジオメトリ、到達可能性、安全な把握を確立するものではありません。
セグメント・エニシングは、見えない名前のある物体を単独で見つけることはありますか?
いいえ。プロンプト可能なマスクを生成します。言語の基盤化は、どのマスクがそのフレーズを表すかを特定する必要があります。
透明なオブジェクトはどのように扱うべきでしょうか?
深度が欠けている、または信頼性の低い場合に適したセンサーやマルチビュー方式を使用し、不確実性は保守的に保ちましょう。
もし2人の候補が依然として妥当なままだったらどうなるでしょうか?
差別的な説明を求め、管理権限を明確にし、恣意的に選ぶのではなく明確にしましょう。
言語から操作可能なインスタンスへの境界
オープン語彙グラウンディングは言語インターフェースを拡張するものであり、操作の確実性を広げるわけではありません。ロボットは、言葉を新しく安定した3Dインスタンスに接続し、接触前に実行可能性を再検証しなければなりません。