[論文レビュー] ISR-LLM: Iterative Self-Refined Large Language Model for Long-Horizon Sequential Task Planning
ISR-LLM は、自然言語を PDDL に変換し、初期計画を生成した後、検証者からのフィードバックを用いて反復的に計画を改善する反復的自己精錬フレームワークを提案する。自然言語の柔軟性を保ちながら、最先端の LLM プランナーと比較して著しく高いタスク成功確率を達成する。
Motivated by the substantial achievements observed in Large Language Models (LLMs) in the field of natural language processing, recent research has commenced investigations into the application of LLMs for complex, long-horizon sequential task planning challenges in robotics. LLMs are advantageous in offering the potential to enhance the generalizability as task-agnostic planners and facilitate flexible interaction between human instructors and planning systems. However, task plans generated by LLMs often lack feasibility and correctness. To address this challenge, we introduce ISR-LLM, a novel framework that improves LLM-based planning through an iterative self-refinement process. The framework operates through three sequential steps: preprocessing, planning, and iterative self-refinement. During preprocessing, an LLM translator is employed to convert natural language input into a Planning Domain Definition Language (PDDL) formulation. In the planning phase, an LLM planner formulates an initial plan, which is then assessed and refined in the iterative self-refinement step by using a validator. We examine the performance of ISR-LLM across three distinct planning domains. The results show that ISR-LLM is able to achieve markedly higher success rates in task accomplishments compared to state-of-the-art LLM-based planners. Moreover, it also preserves the broad applicability and generalizability of working with natural language instructions.
研究の動機と目的
- 長時間スパンの逐次的タスク計画における LLM が生成する計画の妥当性と正しさの低さを是正すること。
- 手動による記号的ドメイン定義なしに、LLM が汎用的かつタスクに依存しないプランナーとして機能できること。
- 検証者からのフィードバックを用いた反復的自己精錬ループにより、計画の信頼性を向上させること。
- 人間が関与する計画においても自然言語指示との互換性を維持すること。
提案手法
- 2段階の LLM パイプライン:まず、翻訳用 LLM が自然言語指示を形式的 PDDL 表記に変換する。
- プランナ LLM が PDDL 形式の問題から初期アクション列を生成する。
- 検証者がシミュレーションによりアクションを実行し、論理的または物理的エラーをチェックすることで、計画の正しさを評価する。
- LLM プランナは検証者からのフィードバックに基づき、計画を反復的に精錬し、有効な計画が得られるまで繰り返す。
- 検証者が計画の正しさと目的達成を推論するのを導くために、Few-shot 例を用いる。
- 反復的補正を通じて形式的計画の妥当性を保証しつつ、エンドツーエンドの自然言語インタラクションを維持する。
実験結果
リサーチクエスチョン
- RQ1反復的自己精錬は、ベースラインの LLM プランナーと比較して、LLM を用いた長時間スパン計画の成功率を顕著に向上させるか?
- RQ2高い計画正しさを達成しつつ、LLM が一般化能力と人間が理解可能な指示処理をどれほど維持できるか?
- RQ3検証者ベースのフィードバックループは、時間的依存性の高い複雑なアクション列におけるエラーをどれほど効果的に検出・是正できるか?
- RQ4PDDL 変換ステップは意味的整合性を保持しており、信頼性の高い後続計画を可能にするか?
主な発見
- ISR-LLM は、3つの異なる計画ドメインにおいて、最先端の LLM ベース計画手法と比較して顕著に高いタスク成功確率を達成した。
- Blocksworld ドメインでは、6つのテストケースのうち5つが正しく検証され、検証者が非クリアなオブジェクトに積み上げるような無効なアクションを効果的に検出できた。
- フレームワークは、非クリアブロックに積み上げを試みるなどの計画エラーを同定・是正し、精錬過程での効果的なエラー検出を示した。
- 反復的自己精錬プロセスにより、実行チェーンの初期段階で無効なアクションを検出し、誤ったアクション列の発生を低減した。
- 検証者は一貫して目的状態の達成を確認し、最終的な計画が論理的に妥当かつ目的に準拠していることを裏付けた。
- システムは自然言語入力との高い互換性を維持しており、形式的正しさを損なわず、人間が関与する計画を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。