[論文レビュー] Generalized Planning in PDDL Domains with Pretrained Large Language Models
本稿では、少量のPDDLタスク例からPythonプログラムを合成することで、GPT-4を用いてPDDLドメインにおける一般化計画者を生成する手法を提案する。思考の流れ(CoT)プロンプトと自動デバッグを組み合わせることで、GPT-4は強力な一般化性能を示し、しばしば2つのトレーニングタスクのみで十分である。これは、LLMが7つのドメインにわたり、強力で効率的かつ検査可能な一般化計画者として機能できることを示している。
Recent work has considered whether large language models (LLMs) can function as planners: given a task, generate a plan. We investigate whether LLMs can serve as generalized planners: given a domain and training tasks, generate a program that efficiently produces plans for other tasks in the domain. In particular, we consider PDDL domains and use GPT-4 to synthesize Python programs. We also consider (1) Chain-of-Thought (CoT) summarization, where the LLM is prompted to summarize the domain and propose a strategy in words before synthesizing the program; and (2) automated debugging, where the program is validated with respect to the training tasks, and in case of errors, the LLM is re-prompted with four types of feedback. We evaluate this approach in seven PDDL domains and compare it to four ablations and four baselines. Overall, we find that GPT-4 is a surprisingly powerful generalized planner. We also conclude that automated debugging is very important, that CoT summarization has non-uniform impact, that GPT-4 is far superior to GPT-3.5, and that just two training tasks are often sufficient for strong generalization.
研究の動機と目的
- 事前学習済みの大規模言語モデル(LLM)が、タスク固有の計画ではなく再利用可能なプログラムを生成するという意味で、PDDLドメインにおける一般化計画者として機能できるかどうかを調査すること。
- GPT-4がPDDLドメインの未観測タスクに一般化可能なドメイン固有のPythonプログラムを合成する効果性を評価すること。
- 思考の流れ要約や自動デバッグといった手法的改善が、プログラムの正しさと一般化性能に与える影響を評価すること。
- GPT-4の性能をGPT-3.5およびアブレーションベースラインと比較し、データ効率性と頑健性を分析すること。
- 従来の手法が複雑または不適切なドメインにおいて、LLMを用いた一般化計画の可能性を検討すること。
提案手法
- PDDLドメインと少量のトレーニングタスク(PDDL形式でエンコード)をGPT-4にプロンプトし、タスク記述を入力として受け取り計画を出力するPythonプログラムを生成する。
- 思考の流れ(CoT)プロンプトを統合し、GPT-4にまず自然言語でドメインを要約し、解決戦略を提示した後でコードを書くように指示する。
- 自動デバッグを適用:生成されたプログラムをトレーニングタスクで実行し、失敗した場合は例外などのフィードバックを提供し、最大4回まで再プロンプトしてエラーを修正する。
- プログラムがトレーニングタスクに対して正当性を検証し、フィードバックループを通じて段階的に改善するパイプラインを用いる。
- 探索ベースの計画を避けるようプログラムを合成し、指示に従い、単純で探索を伴わない戦略を優先する。
- 6つの既存ドメインに加え、1つの新規ドメインを含む7つのPDDLドメインで評価し、アブレーションとベースラインとを比較する。

実験結果
リサーチクエスチョン
- RQ1GPT-4は、少量の例から再利用可能なPythonプログラムを生成することで、PDDLドメインにおける一般化計画者を効果的に合成できるか?
- RQ2思考の流れプロンプトは、合成された一般化計画の質と正しさにどのような影響を及えるか?
- RQ3自動デバッグは、LLMが生成する計画者の信頼性と一般化性能をどの程度向上させるか?
- RQ4GPT-4は、多様なPDDLドメインにおいてGPT-3.5と比較して、一般化計画性能で優れているか?
- RQ5強力な一般化を達成するために最小限必要なトレーニングタスク数はどれくらいか?また、例が少ない場合に性能が低下するか?
主な発見
- GPT-4は驚くほど強力な一般化計画者であり、7つのPDDLドメインで複数のベースラインおよびアブレーションを上回っている。
- 自動デバッグは不可欠である:これなしではGPT-4は頻繁に誤ったまたは機能しないコードを生成するが、自動デバッグを適用することで成功率が著しく向上する。
- 思考の流れプロンプトは一様ではない影響を及ぼす:一部のドメインでは役立つが、すべてのドメインで一貫して有益とは限らない。
- GPT-4はGPT-3.5を著しく上回っており、一般化計画における推論力とコード生成能力に優れていることが示された。
- 2つのトレーニングタスクで十分な一般化が達成されることが多く、自動デバッグ中に3番目のタスクが必要になるケースはわずかにしかなかった。
- PDDLの名前が削除されても、LLMは構文的構造から学習して効果的に一般化できるが、名前があるとほとんどの場合性能が向上する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。