[論文レビュー] CAPE: Corrective Actions from Precondition Errors using Large Language Models
CAPEは、タスク計画中の失敗行動に対する是正行動を生成するために、事前条件エラーのフィードバックを用いた再プロンプトフレームワークである。テンプレート化されたプロンプトを通じて失敗の文脈を注入することで、計画の実行可能性と正しさが向上し、VirtualHomeでは49.63%の計画正しさを達成し、Boston Dynamics SpotロボットではSayCanと比較して76.49%の向上を達成した。
Extracting commonsense knowledge from a large language model (LLM) offers a path to designing intelligent robots. Existing approaches that leverage LLMs for planning are unable to recover when an action fails and often resort to retrying failed actions, without resolving the error's underlying cause. We propose a novel approach (CAPE) that attempts to propose corrective actions to resolve precondition errors during planning. CAPE improves the quality of generated plans by leveraging few-shot reasoning from action preconditions. Our approach enables embodied agents to execute more tasks than baseline methods while ensuring semantic correctness and minimizing re-prompting. In VirtualHome, CAPE generates executable plans while improving a human-annotated plan correctness metric from 28.89% to 49.63% over SayCan. Our improvements transfer to a Boston Dynamics Spot robot initialized with a set of skills (specified in language) and associated preconditions, where CAPE improves the correctness metric of the executed task plans by 76.49% compared to SayCan. Our approach enables the robot to follow natural language commands and robustly recover from failures, which baseline approaches largely cannot resolve or address inefficiently.
研究の動機と目的
- LLMベースの計画において失敗回復が不足している問題に対処し、エージェントが根拠のない再試行を繰り返すのを防ぐ。
- 体現的エージェントが、LLMsを用いてタスク実行中に事前条件違反を自主的に是正できるようにする。
- 特定の事前条件エラーに焦点を当てた是正推論により、包括的なスキル探索への依存を減らす。
- シミュレーテッド環境および現実世界のロボット環境の両方で、計画の実行可能性と意味的正しさを向上させる。
- 特に大規模なスキルレパートリー設定において、SayCanなどのベースライン手法と比較して再プロンプトや計算コストを最小限に抑える。
提案手法
- 行動実行に失敗した際に、事前条件エラー情報をLLMsに注入するためのテンプレートプロンプトを用いた再プロンプト戦略であるCAPEを導入する。
- 意味的に類似したデモタスクをfew-shotの文脈学習として活用し、LLMが是正行動を生成するのをガイドする。
- 2段階のパイプラインを採用する:まず、計画LLMが自由形式の行動シーケンスを生成し、次に、翻訳LLMがそれらをエージェントのスキルレパートリーからの実行可能行動にマッピングする。
- 失敗した行動からのフィードバック(具体的には、違反された事前条件)をプロンプトに組み込み、LLMが是正行動を導くように誘導する。
- 利用可能なドメイン知識やフィードバックの粒度に応じて、再プロンプト手法を調整することで、小規模および大規模なスキルレパートリーの両方をサポートする。
- 完全なスキル空間の反復を回避することで効率性を最適化し、時間計算量をSayCanのO(|s|^n)からO(n)に削減する。
実験結果
リサーチクエスチョン
- RQ1計画中に事前条件エラーのフィードバックが与えられた場合、LLMsは意味的に正しい是正行動を生成できるか?
- RQ2事前条件エラー情報の注入は、ベースラインのLLM計画手法と比較して、計画の実行可能性と正しさをどのように向上させるか?
- RQ3大規模なスキルレパートリー設定において、CAPEは再プロンプトや計算オーバーヘッドの必要性をどの程度低減できるか?
- RQ4CAPEは、最小限のドメイン特化チューニングで、シミュレーテッド環境および現実世界のロボットシステムの両方で一般化可能か?
- RQ5完全なアフォーダンスモデルにアクセスできないにもかかわらず、CAPEはSayCanのようなオラクルベースの手法を正しさと効率性の両面で上回るか?
主な発見
- VirtualHomeシミュレーション環境において、CAPEはSayCanと比較して人為アノテート済みの計画正しさを28.89%から49.63%に向上させた。
- Boston Dynamics Spotロボットにおいて、CAPEはSayCan(オラクル設定)と比較して計画正しさで76.49%の絶対的向上を達成した。
- 明示的な原因とfew-shotプロンプティングを用いたロボットデモでは、CAPEは100%の実行可能性を達成し、すべてのベースラインを上回った。
- 時間計算量はSayCanのO(|s|^n)からO(n)に削減され、大規模なスキルレパートリーを持つ環境でのスケーラビリティが著しく向上した。
- 視覚フィードバックや完全なアフォーダンスモデルにアクセスできない状況でも、CAPEはより意味的に正しい計画を生成し、事前条件違反のエラーを減らした。
- 正しさの評価において、アノテーター間一致性はFleiss’ Kappaで中程度であったが、再サンプリングベースラインではアノテーター全員が計画を非実行可能と判断し、一致率が100%であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。