Skip to main content
QUICK REVIEW

[論文レビュー] Improving Planning with Large Language Models: A Modular Agentic Architecture

Taylor W. Webb, Shanka Subhra Mondal|arXiv (Cornell University)|Sep 30, 2023
Natural Language Processing TechniquesComputer Science被引用数 3
ひとこと要約

本稿では、大規模言語モデル(LLM)における計画性能を向上させるために、前頭前皮質(PFC)にインspiredされたモジュラーアーキテクチャ「LLM-PFC」を提案する。このアーキテクチャは、複雑なタスクを、タスク分解、アクション生成、モニタリング、予測、評価、調整といった、専門的なLLMモジュールに分解することで機能を分担化する。グラフ走査およびハノイの塔のタスクにおいて評価された結果、標準的なプロンプティング手法を著しく上回り、脳にインspiredされたモularityがLLMにおけるマルチステップ推論を強化することを示している。

ABSTRACT

Large language models (LLMs) demonstrate impressive performance on a wide variety of tasks, but they often struggle with tasks that require multi-step reasoning or goal-directed planning. Both cognitive neuroscience and reinforcement learning (RL) have proposed a number of interacting functional components that together implement search and evaluation in multi-step decision making. These components include conflict monitoring, state prediction, state evaluation, task decomposition, and orchestration. To improve planning with LLMs, we propose an agentic architecture, the Modular Agentic Planner (MAP), in which planning is accomplished via the recurrent interaction of the specialized modules mentioned above, each implemented using an LLM. MAP improves planning through the interaction of specialized modules that break down a larger problem into multiple brief automated calls to the LLM. We evaluate MAP on three challenging planning tasks -- graph traversal, Tower of Hanoi, and the PlanBench benchmark -- as well as an NLP task requiring multi-step reasoning (strategyQA). We find that MAP yields significant improvements over both standard LLM methods (zero-shot prompting, in-context learning) and competitive baselines (chain-of-thought, multi-agent debate, and tree-of-thought), can be effectively combined with smaller and more cost-efficient LLMs (Llama3-70B), and displays superior transfer across tasks. These results suggest the benefit of a modular and multi-agent approach to planning with LLMs.

研究の動機と目的

  • マルチステップ推論や目的指向の計画において、LLMが繰り返し失敗する問題に取り組むこと。特に、体系的かつ階層的な推論を要するタスクにおいて。
  • 人間の前頭前皮質(PFC)のサブ領域にインspiredされた、機能的に異なる専用モジュールを用いてLLMを構造化することで、計画性能が向上するかどうかを調査すること。
  • ゼロショットプロンプティングやインラインコンテキスト学習の限界を克服し、専用のLLMコンponents間の自律的協調を可能にすること。
  • 認知神経科学の原則に基づくブラックボックスでモジュラなアーキテクチャが、LLMにおける信頼性の高いスケーラブルな計画を実現できるかどうかを評価すること。
  • 計画を離散的で専門的な機能(例:モニタリング、予測、評価)に分解することで、正確性が向上し、幻覚やループが減少するかどうかを検討すること。

提案手法

  • 6つの専用GPT-4ベースのモジュール(TaskDecomposer, Actor, Monitor, Predictor, Evaluator, TaskCoordinator)を実装し、それぞれが異なる認知的機能を担当する。
  • 各モジュールは、少数の例を用いたインラインコンテキスト学習により、特定のタスク(例:部分目標の生成、アクションの提案、状態遷移の評価)を実行するようにプロンプトされる。
  • アクション提案(Actor)、状態予測(Predictor)、状態評価(Evaluator)を組み合わせることで木探索を実行し、バックトラッキングと経路選択を可能にする。
  • エラーのモニタリングは、制約違反する行動を拒否することで実装される。このMonitorモジュールにより、幻覚や無効な動きが低減される。
  • タスクの調整は、TaskCoordinatorが行い、部分目標の完了状況と最終的な目標達成状況を追跡。すべての部分目標が達成された段階で計画を出力する。
  • このアーキテクチャはクローズドループシステムとして動作し、モジュール間の反復的相互作用により、計画を段階的に精錬・検証する。
Figure 1: LLM-PFC architecture. The agent receives states from the environment and high-level goals. These are processed by a set of specialized LLM modules. The $\operatorname{TaskDecomposer}$ receives high-level goals and generates a series of subgoals. The $\operatorname{Actor}$ generates propose
Figure 1: LLM-PFC architecture. The agent receives states from the environment and high-level goals. These are processed by a set of specialized LLM modules. The $\operatorname{TaskDecomposer}$ receives high-level goals and generates a series of subgoals. The $\operatorname{Actor}$ generates propose

実験結果

リサーチクエスチョン

  • RQ1モジュラでPFCにインspiredされたアーキテクチャは、複雑なマルチステップタスクにおけるLLMの計画性能を向上させることができるか?
  • RQ2各々が異なる認知的機能を担当する専用のLLMモジュールは、単一のプロンプティングに比べて、推論および計画において優れた性能を示すか?
  • RQ3予測、評価、モニタリングといったモジュールの協調が、LLM計画における幻覚やループの発生をどの程度低減できるか?
  • RQ4認知神経科学の原則に基づいたブラックボックスでプロンプティングベースのモジュラシステムは、計画ベンチマークにおいて、標準的なゼロショットまたはインラインコンテキスト学習を上回る結果を出すことができるか?
  • RQ5LLMアーキテクチャに認知神経科学の原則を統合することで、体系的推論および目的指向行動における測定可能な向上が得られるか?

主な発見

  • LLM-PFCアーキテクチャは、グラフ走査およびハノイの塔の計画タスクにおいて、標準的なLLMプロンプティング手法を著しく上回った。
  • グラフ走査タスクでは、有効なパスを効率的に特定する高い成功率を達成し、ベースラインモデルで見られる幻覚的または無効な遷移を大幅に削減した。
  • ハノイの塔タスクでは、ゼロショットプロンプティングに比べて成功確率が向上したが、依然として最適でない結果であり、さらなる最適化の余地があることが示された。
  • 専用のMonitorモジュールの導入により、無効なアクションや制約違反が効果的に低減され、ループや誤った状態遷移が最小限に抑えられた。
  • PredictorおよびEvaluatorモジュールによる木探索の統合により、状態空間の体系的探索が可能になり、計画の質と信頼性が向上した。
  • 結果は、PFCのサブ領域にインspiredされた、機能的特化とモジュール間の協調的相互作用が、標準的なプロンプティングでは達成できない計画性能の向上を実現できることを支持する。
Figure 2: Graph Traversal. We investigated two graph traversal tasks utilizing a challenging graph with community structure. Steppath: Find shortest path between two nodes, e.g. node 3 and node 7. Valuepath: Find shortest path from starting location (e.g., node 10) to location with maximum reward (n
Figure 2: Graph Traversal. We investigated two graph traversal tasks utilizing a challenging graph with community structure. Steppath: Find shortest path between two nodes, e.g. node 3 and node 7. Valuepath: Find shortest path from starting location (e.g., node 10) to location with maximum reward (n

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。