[論文レビュー] Understanding the Capabilities of Large Language Models for Automated Planning
この論文は、PDDLを用いた自動計画における大規模言語モデル(LLM)の能力を調査し、コードで事前学習されたLLMの微調整が、既知のドメインにおける計画生成を顕著に向上させることを明らかにしたが、未知のドメインへの一般化能力は依然として限定的であることを示した。本研究では、計画の一般化を測る新しい指標を提案し、今後のLLMベースの計画分野の研究を促進するため、モデル重みを含む公開ベンチマークを提供した。
Automated planning is concerned with developing efficient algorithms to generate plans or sequences of actions to achieve a specific goal in a given environment. Emerging Large Language Models (LLMs) can answer questions, write high-quality programming code, and predict protein folding, showcasing their versatility in solving various tasks beyond language-based problems. In this paper, we aim to explore how LLMs can also be used for automated planning. To do so, we seek to answer four key questions. Firstly, we want to understand the extent to which LLMs can be used for plan generation. Secondly, we aim to identify which pre-training data is most effective in facilitating plan generation. Thirdly, we investigate whether fine-tuning or prompting is a more effective approach for plan generation. Finally, we explore whether LLMs are capable of plan generalization. By answering these questions, the study seeks to shed light on the capabilities of LLMs in solving complex planning problems and provide insights into the most effective approaches for using LLMs in this context.
研究の動機と目的
- PDDLで表現された古典的計画問題に対して、LLMが有効かつ最適な計画を生成できる程度を評価すること。
- LLMの計画生成能力を向上させるために、どの事前学習データ(例:コード対自然言語)が効果的であるかを特定すること。
- 計画生成の向上に向けたプロンプティングと微調整の有効性を比較すること。
- 計画長、オブジェクト名の変更、および未知の計画ドメインにおけるLLMの一般化能力を評価すること。
提案手法
- PDDLベンチマークに含まれる6つの古典的計画ドメインを多様に用いて、CodeT5およびcode-davinciを微調整した。
- 訓練ドメインからの例を用いたfew-shotプロンプティングを適用し、ゼロショットおよびfew-shot計画生成を評価した。
- 計画長やオブジェクト名の変更に対する正しさをもとに、一般化度を定量化する新しい指標$E_{pg}$を提案した。
- 子供用おやつ(childsnack)、デポ(depots)、人工衛星(satellite)といった未知のドメインを用いて、ドメイン間一般化を評価した。
- 再現可能性を確保し、今後の研究を支援するため、モデル重みとベンチマーク問題を含む公開コードベースを用いた。
- 計画の正しさ、計画長の一般化、ランダム化されたオブジェクト名に対するロバスト性を評価した。
実験結果
リサーチクエスチョン
- RQ1LLMはPDDLで表現された計画問題をどの程度解けるか?
- RQ2計画生成を促進するために、どの事前学習データが最も効果的か?
- RQ3微調整とプロンプティングのどちらが計画生成性能を向上させるか?
- RQ4LLMは未知の計画ドメインや異なる計画長に一般化できるか?
主な発見
- 事前学習済みのLLMは、微調整なしでは計画問題を効果的に解くことはできない。
- コードで事前学習されたLLM(例:CodeT5、code-davinci)は、自然言語のみで学習されたモデルよりも計画生成において優れている。
- 微調整は計画生成を顕著に向上させ、プロンプティングに比べて正しさが向上し、未知の計画長に対してもより良い一般化を示した。
- 語彙が訓練データと一致する場合、微調整済みモデルはランダム化されたオブジェクト名に対しても部分的な一般化を示したが、語彙が乖離すると失敗した。
- childsnack、depots、satelliteのような完全に未知のドメインでは、プロンプティングおよび微調整の両方とも完全に失敗し、$E_{pg} = 1$(有効な計画が生成されなかった)を示した。
- 提案された$E_{pg}$指標は計画一般化を効果的に捉えており、長さや構造の一般化には進展があるものの、ドメイン一般化には依然として課題が残っていることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。