ロングホライズンロボットタスクの記憶と回復

長期的なロボットの課題は、多くのスキルを組み合わせ、その結果が世界を変えます。したがって、信頼性は長いリストを一度作成することよりも、各後処理条件の検証、有効な部分進行の保持、現在の状態からの回復の選択に依存します。

言語文脈やプランの書き起こしだけでは十分なメモリではありません。操作には構造化された事実、リソース、副作用、証拠、タイムスタンプ、出所が必要であり、再起動によって完了した作業と、結果が一度も観察されていない不確かなコマンドを区別できます。

このガイドを Nav2 回復ガイド失敗採掘ガイドと一緒に使ってください。すべての外部操作を、監査可能な受領書付きの状態遷移として扱いましょう。

ミッションをクローズドループステートマシンとして表現する

目標、前提条件、スキル、期待される効果、禁止状態、完了条件をモデル化します。各スキルの後は、世界を観察し、現在の証拠から次の移行を選び、計画された効果が起こったと仮定するのではなく、

計画、実行、検証、回復を明確に指示し続けてください。これにより、タイムアウト、中断、人間の乗っ取り行動が会話履歴の中に隠されるのではなく、テスト可能になります。

NASAのK10ローバーが北極クレーター地形で長距離現地試験を行う
長期の現地任務には、持続的な任務状況、地図の文脈、証拠に基づくチェックポイントが必要です。写真は特定の計画建築を示していません。出典: NASA経由ウィキメディア・コモンズ。利用条件: パブリックドメイン、NASAの作品

進捗が保護されたタスクグラフを作成する

サブゴールグラフは依存関係を特定し、再計画時に保存すべき完了した効果を特定します。物を動かしたり、ドアを開けたり、物資を配ったりすることは、全体の作業が未完了のままであってもコストがかかったり取り返しがつかないことがあります。

補償アクションと繰り返しない遷移をマークしてください。新しいプランは、認可された回収が意図的に変更しない限り、保護状態を尊重しなければなりません。

記録生涯欠席時の失敗
事実対象はビンBにいます矛盾するまで間違った計画だ
リソースツール予約済みリリースまで対立
受領書指揮権と結果監査の寿命重複アクション
検問所検証済みタスク状態回復寿命再起動損失
判決なぜこの分野が選ばれたのか監査の寿命追跡不可能な行動

観察された後の状態とスキルリターンを分離する

制御者は、軌道が終わった際に物体が滑ったため成功を報告できます。物体の姿勢、ドアの状態、在庫数、ナビゲーション到着などの後条件を定義し、可能な限り独立した観察で検証します。

証拠と新鮮さを保存しましょう。未検証の成功は、完了した事実ではなく、不確かな状態になるべきです。

すべての副作用に対して実行結果の記録を書きます

レシートにはコマンド識別子、パラメータ、試み、開始・終了時刻、コントローラー結果、観測された効果、証拠、変更されたリソース、復旧状況が記録されます。それは高レベルの計画と物理的な結果を結びつけます。

再起動時には、未払いの領収を世界と照合してから次のコマンドを出してください。これは特に、ロボットが行動した後に認識が届く前に通信が失敗した場合に重要です。

可能な限り、物理的な命令を冪等にする

冪等性キーは、下流サービスが繰り返しリクエストを認識し、2回動作する代わりに前回の結果を返すことを可能にします。物理的操作は数学的に冪等性には常にできないため、実行者は現在の状態や行動履歴も確認しなければなりません。

ディスペンション、支払い、ドア操作、アイテム転送などの副作用を、固有の操作識別で保護します。タイムアウトが何も起こらなかったことを意味すると推測しないでください。

5段階ロングホライズンロボットリカバリバリテーション
不確かな結果の後に同じコマンドを繰り返すと、動きが重複したり、進行が一部破棄されたり、新たな失敗が生じたりします。出典:Physical AI Lab。

部分的成功を新しい初期状態として保持する

5つのうち3つがすでに並べ替えられている場合、元の計画からやり直すと再び移動したり、数を失う可能性があります。検証済みのサブゴールをコミットし、安全とタスク制約を維持しつつ新しい状態から再計画します。

二択的なミッション成功だけでなく、有益な進捗を測定しましょう。完了した保護されたサブゴール、損傷した資源、残された実行可能な目標を追跡します。

再挑戦する前に失敗を分類する

知覚、局所化、計画、把握、制御、環境、資源、通信の失敗を区別する。リトライは、同じ条件を盲目的に繰り返すのではなく、関連するパラメータ、視点、理解、経路、スキルを変えるべきです。

クラスごとの予算、クールダウン、エスカレーションを設定しましょう。国家が悪化したり、不確実性が増したりすると再挑戦をやめてください。さもなければ次の試みが危険な仕組みを繰り返すでしょう。

要約だけではなく、事実と制約に基づいて再計画する

自然言語の要約は文脈を圧縮しますが、出所、タイムスタンプ、例外を省略することもあります。プランナーに、構造化された現状、未解決の矛盾、利用可能なスキル、保護された進捗、禁止された行動を提供します。

SayCanプロジェクトは、報告されたモバイル操作実験において、言語モデルの有用性とスキルの適性値を組み合わせています。また、プロジェクトページでは現在の段階環境フィードバックの制限も記載されており、明確なクローズドループの状態更新を促しています。

スキルの後は環境フィードバックを活用する

Inner Monologue論文は、評価された環境環境でのフィードバックを用いた計画を研究しています。運用上の教訓は、次の決定に対して成功検出器、シーン記述、人間のフィードバック入力を、アクション名だけを付け加えるのではなく、

フィードバック源によって意見が分かれることもあります。生の証拠を保存し、最新のテキストが認証済みの状態を静かに上書きするのではなく、信頼度と矛盾ルールを適用しましょう。

中断とソフトウェア再起動のチェックポイント

チェックポイントには、タスクグラフのバージョン、現在の状態、検証済みの事実、保留中の領収書、リソースロック、保護された進行状況、ロボットのポーズコンテキスト、モデルバージョン、復旧認証を含めるべきです。コミットした効果の後やリスクの高い移行の前にセーブしましょう。

コールド再起動をネットワークの損失、プロセスクラッシュ、センサーの古さでテストしてください。システムはシリアル状態から再開する前に物理的現実を調整しなければなりません。

完了度、一貫性、回復コストの評価

報告:完全および部分的完了、確認された後期発生率、重複副作用、矛盾数、再試行、回復成功率、人的介入、時間および資源コスト。スキルごとの成功だけでは悪化し、国家の腐敗を隠してしまう。

Code as Policiesは 、報告されたタスクにおいて言語モデル生成のロボットプログラムを示しています。どんな展開でも、バウンドツール、状態検証、ロールバック、ターゲット固有の失敗テストが必要です。

テスト故障期待される行動メートル法
結果不確か認識の喪失繰り返す前に和解重複率
部分的な成功任務中の失敗有効な進行状況を保つ保持されたサブゴール
知覚ドリフト矛盾した事実新たな証拠の要求一貫性
プロセスクラッシュコールドリスタートチェックポイントの読み込みと検証履歴書の成功
再挑戦の疲労繰り返される故障安全なハンドオフエスカレーション時間

復旧可能なミッション契約を公開する

バージョンタスクグラフ、スキルスキーマ、後処理条件、レシートストア、再試行ルール、チェックポイント、紛争解決、人間による引き継ぎの状態などが含まれます。すべての計画変更と観察された証拠を結びつける完全なイベントトレースを保存してください。

以下のチェックを伴ったクローズリリースレビュー。

  • 前提条件、効果、禁止状態を代表します。
  • 世界中のポストコンディションを確認しましょう。
  • 副作用には領収書と重複保護を使いましょう。
  • 部分的な成功を保ち、再試行を分類してください。
  • 演習中断、チェックポイントの和解、そして人間の引き渡し。

よくある質問

より大きな LLM の文脈で長期的なロボットタスクを解決できるのでしょうか?

いいえ。コンテキストは計画に役立ちますが、信頼性の高い実行には構造化された状態、事後条件証拠、回復セマンティクスが必要です。

行動木はタスクメモリとどのように関係しているのでしょうか?

振る舞い木は制御フローを整理します。耐久記憶は、実行ごとに使用された事実、領収書、チェックポイント、証拠を保存します。

失敗後に最初からやり直すのが最も安全ですか?

過去の行動が世界を変えた今では、決定する前に、妥当な進行状況を調整し、維持してください。

スキルは何回リトライされるべきでしょうか?

リスク、状態変更、得られた情報からクラスごとの予算を設定し、繰り返しが役に立たなくなったらエスカレーションします。

部分的な成功はどのように測定されるのでしょうか?

確認済みの保護されたサブゴール、残りの実行可能な目標、副作用、回復コストは完全な完了とは別に追跡します。

検証状態と履歴境界

長期ロボットの信頼性は、検証された状態遷移、耐久性のある受領、回復可能なチェックポイントから得られます。より長い計画や文脈の窓は、物理的世界に関する証拠の代わりにはなりません。