[論文レビュー] Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
Tree-Plannerは、計画サンプリング、アクションツリー構築、接地された意思決定の3段階フレームワークを提案することで、LLMベースのタスク計画における効率性を向上させ、トークン消費とエラー訂正のオーバーヘッドを削減する。反復的LLM計画と比較して、92.2%の低いトークン使用量と40.5%の少ないエラー訂正回数を達成しながら、VirtualHomeシミュレーションにおける最先端のパフォーマンスを維持する。
This paper studies close-loop task planning, which refers to the process of generating a sequence of skills (a plan) to accomplish a specific goal while adapting the plan based on real-time observations. Recently, prompting Large Language Models (LLMs) to generate actions iteratively has become a prevalent paradigm due to its superior performance and user-friendliness. However, this paradigm is plagued by two inefficiencies: high token consumption and redundant error correction, both of which hinder its scalability for large-scale testing and applications. To address these issues, we propose Tree-Planner, which reframes task planning with LLMs into three distinct phases: plan sampling, action tree construction, and grounded deciding. Tree-Planner starts by using an LLM to sample a set of potential plans before execution, followed by the aggregation of them to form an action tree. Finally, the LLM performs a top-down decision-making process on the tree, taking into account real-time environmental information. Experiments show that Tree-Planner achieves state-of-the-art performance while maintaining high efficiency. By decomposing LLM queries into a single plan-sampling call and multiple grounded-deciding calls, a considerable part of the prompt are less likely to be repeatedly consumed. As a result, token consumption is reduced by 92.2% compared to the previously best-performing model. Additionally, by enabling backtracking on the action tree as needed, the correction process becomes more flexible, leading to a 40.5% decrease in error corrections.
研究の動機と目的
- 反復的LLMベースのタスク計画におけるトークン非効率性と訂正非効率性を解消すること。
- 複数の計画ステップにわたる繰り返しのプロンプトトークン消費を低減すること。
- 完全な計画再生成を伴わずに、柔軟でバックトラッキングベースのエラー訂正を可能にすること。
- スケーラビリティを向上させながら、実世界への展開を考慮した高いパフォーマンスを維持すること。
- ファインチューニングやアーキテクチャ変更を回避する、効率的で推論時フレームワークを提供すること。
提案手法
- Tree-Plannerは、最初に共通の知識に基づいて複数の潜在的タスク計画をサンプリングするための1回のLLMコールを実行する。
- サンプリングされた計画を統合・構造化し、階層的意思決定グラフとして表現するアクションツリーを構築する。
- 実行段階では、LLMがリアルタイムの環境観測に基づいてツリー上でトップダウンで接地された推論を実行する。
- 失敗したアクションは、グローバルな再計画を伴わずに局所的な訂正が可能なツリー上のバックトラッキングを引き起こす。
- フレームワークは計画生成と実行を分離することで、繰り返しのプロンプトトークンを最小限に抑える。
- ファインチューニングを一切行わず、プロンプト工学とツリー基盤の推論に依存するブラックボックスLLMを活用する。
実験結果
リサーチクエスチョン
- RQ1繰り返しのプロンプト使用を最小限に抑えることで、LLMベースのタスク計画におけるトークン消費を削減できるか?
- RQ2構造化された計画ツリー上でバックトラッキングを可能にすることで、エラー訂正の効率性を向上させられるか?
- RQ3反復的かつ自己回帰的なLLMコールに依存しない状態で、高いタスク成功確率を維持できるか?
- RQ4アクションツリーを用いた「生成して選択する」アプローチと、エンドツーエンドの反復的プロンプト提示の両者を、効率性と頑健性の観点から比較するとどうなるか?
- RQ5計画の多様性とツリー構造は、意思決定の質と訂正の柔軟性にどのような影響を与えるか?
主な発見
- Tree-Plannerは、最良の反復的ベースラインと比較して、92.2%のトークン消費削減を達成した。
- アクションツリー上の柔軟なバックトラッキングにより、エラー訂正頻度が40.5%削減された。
- 複雑な家庭内タスクのVirtualHomeベンチマークにおいて、最先端のパフォーマンスを達成した。
- 単一の計画サンプリングコールにより、各ステップでグローバルなコンテキストやインライン例の繰り返し包含を回避した。
- アクションツリーにより、環境に接地された細粒度の意思決定が可能となり、ローカルおよびグローバルな再計画戦略を上回る性能を発揮した。
- 定性的な分析から、モデルの失敗事例の主な原因は計画サンプリングの誤りまたは環境への不完全な接地に起因することが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。