[論文レビュー] Agent Planning with World Knowledge Model
本論文は、エキスパート軌跡とサンプル軌跡からグローバルなタスク知識と動的状態知識を合成することで、LLMベースのエージェント計画を強化するパrametric World Knowledge Model (WKM)を提案する。kNN検索と重み付き行動予測を用いてこの知識をエージェントの計画プロセスに統合することで、幻覚的行動や試行錯誤を顕著に低減し、Mistral-7B、Gemma-7B、Llama-3-8BといったオープンソースLLMを用いた3つの現実世界シミュレート環境において、最先端のパフォーマンスを達成した。
Recent endeavors towards directly using large language models (LLMs) as agent models to execute interactive planning tasks have shown commendable results. Despite their achievements, however, they still struggle with brainless trial-and-error in global planning and generating hallucinatory actions in local planning due to their poor understanding of the ``real'' physical world. Imitating humans' mental world knowledge model which provides global prior knowledge before the task and maintains local dynamic knowledge during the task, in this paper, we introduce parametric World Knowledge Model (WKM) to facilitate agent planning. Concretely, we steer the agent model to self-synthesize knowledge from both expert and sampled trajectories. Then we develop WKM, providing prior task knowledge to guide the global planning and dynamic state knowledge to assist the local planning. Experimental results on three complex real-world simulated datasets with three state-of-the-art open-source LLMs, Mistral-7B, Gemma-7B, and Llama-3-8B, demonstrate that our method can achieve superior performance compared to various strong baselines. Besides, we analyze to illustrate that our WKM can effectively alleviate the blind trial-and-error and hallucinatory action issues, providing strong support for the agent's understanding of the world. Other interesting findings include: 1) our instance-level task knowledge can generalize better to unseen tasks, 2) weak WKM can guide strong agent model planning, and 3) unified WKM training has promising potential for further development. The code is available at https://github.com/zjunlp/WKM.
研究の動機と目的
- LLMベースのエージェントが計画タスクにおいて、世界理解が不十分なために生じる盲目的な試行錯誤や幻覚的行動といった限界を是正すること。
- グローバルな事前知識とローカルな動的状態認識の両方をモデル化することで、LLMと人間の計画行動のギャップを埋めること。
- 手動のプロンプトを一切用いずに、軌跡からタスク知識と状態知識を生成する、トレーニング可能なパrametric World Knowledge Model (WKM)を構築すること。
- 未学習のタスクにも一般化可能であり、最小限の推論オーバーヘッドで効率的な知識拡張計画を可能にするWKMの実装を実現すること。
- 多様な環境とLLMアーキテクチャ、特に強力なオープンソースモデルを含む、WKMの有効性を実証すること。
提案手法
- エージェントモデルを用いてエキスパート軌跡とサンプル軌跡を比較することで、キーワードとなる計画ステップと一般的な制約を同定し、タスク知識を自己合成する。
- 各計画ステップに対して、直前の行動と次の行動の文脈を用いて、現在の世界状態を要約するプロンプトをエージェントに発行し、状態知識を生成する。
- 行動遷移に関連付けられた自然言語による世界状態の記述を保存することで、状態知識ベースを構築する。
- LoRA微調整を用いてWKMをエージェントモデルと統合し、パramータ効率を確保するために、同じLLMバックボーンを共有する。
- 推論時、現在の行動をクエリとして用い、状態知識ベース上でkNN検索を実行し、関連する状態表現を取得する。
- 取得した状態知識、過去の行動文脈、エージェントモデルの確率を重み付き予測に統合し、次の行動を予測することで幻覚的行動を低減する。
実験結果
リサーチクエスチョン
- RQ1自己合成されたWorld Knowledge Modelは、LLMベースのエージェント計画において、盲目的な試行錯誤や幻覚的行動を低減できるか?
- RQ2固定プロンプトや手作業で設計されたプロンプトと比較して、インスタンスレベルのタスク知識は未学習タスクにどの程度一般化できるか?
- RQ3弱いWKMが強いエージェントモデルを効果的に導くことは可能か?これは、弱いものによる強いものガイドのパラダイムの妥当性を示す。
- RQ4統合的でマルチタスクなWKM学習は、多様な環境においてより優れた一般化性とスケーラビリティを提供するか?
- RQ5明示的な状態知識の提供がエージェント計画パフォーマンスに与える影響は何か?性能を向上させるか、悪化させるか?
主な発見
- 提案されたWKMは、無思考的試行錯誤や無効な行動を顕著に低減し、ALFWorld、WebShop、ScienceWorldにおける実験的結果から、成功確率の向上が確認された。
- モデル生成のインスタンスレベルタスク知識は、固定プロンプトや手作業で設計されたプロンプトよりも未学習タスクへの一般化性能が優れており、分布シフトに対して強い耐性を示している。
- 弱いものによる強いものガイドのパラダイムは実現可能である:たとえWKMが弱くても、強力なLLMエージェントを効果的に導くことができ、計画における知識蒸留のスケーラビリティを示した。
- 複数のタスクにわたる統合的WKM学習は、将来的な開発において強く有望な兆しなのであり、マルチタスク知識学習が一般化性能を向上させることを示唆している。
- 推論時に明示的に状態知識を注入するとパフォーマンスが低下することが判明した。これは、知識ベースからの動的検索の方が、静的インジェクションよりも効果的であることを示している。
- 本手法は、Mistral-7B、Gemma-7B、Llama-3-8Bを含む3つのオープンソースLLMを用いて、3つの複雑なシミュレート環境において、最先端のパフォーマンスを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。