[論文レビュー] Plansformer: Generating Symbolic Plans using Transformers
Plansformer は、最小限の知識工学で、最小限の知識工学を要する、シンボリック計画を生成できる、ファインチューニングされたトランスフォーマー基盤の大規模言語モデルを導入している。このモデルは、トワーズ・オブ・ハノイ領域において、約97%の妥当性と約95%の最適性を達成しており、多様な計画領域にわたる一般化を可能にするトランスファー学習を活用している。
Large Language Models (LLMs) have been the subject of active research, significantly advancing the field of Natural Language Processing (NLP). From BERT to BLOOM, LLMs have surpassed state-of-the-art results in various natural language tasks such as question answering, summarization, and text generation. Many ongoing efforts focus on understanding LLMs' capabilities, including their knowledge of the world, syntax, and semantics. However, extending the textual prowess of LLMs to symbolic reasoning has been slow and predominantly focused on tackling problems related to the mathematical field. In this paper, we explore the use of LLMs for automated planning - a branch of AI concerned with the realization of action sequences (plans) to achieve a goal, typically executed by intelligent agents, autonomous robots, and unmanned vehicles. We introduce Plansformer; an LLM fine-tuned on planning problems and capable of generating plans with favorable behavior in terms of correctness and length with reduced knowledge-engineering efforts. We also demonstrate the adaptability of Plansformer in solving different planning domains with varying complexities, owing to the transfer learning abilities of LLMs. For one configuration of Plansformer, we achieve ~97% valid plans, out of which ~95% are optimal for Towers of Hanoi - a puzzle-solving domain.
研究の動機と目的
- 大規模言語モデル(LLM)の能力を自然言語タスクから、自動計画におけるシンボリック推論に拡張すること。
- 計画タスクにおけるLLMのトランスファー学習を活用することで、膨大な知識工学の必要性を低減すること。
- 多様で複雑性の異なる計画領域を統一的に処理できるフレームワークの開発。
- 正しさ、最適性、計画長の観点から、シンボリック計画生成の性能を評価すること。
提案手法
- 計画問題とその対応するシンボリック計画のキュレート済みデータセット上で、事前学習済みのトランスフォーマー基盤LLMをファインチューニングすること。
- LLMの入出力に適した、構造的でテキストベースのフォーマットで、計画問題と解決策を表現すること。
- モデルのアテンションメカニズムを活用し、シンボリック計画シーケンス内の長距離依存関係と構造的パターンを捉えること。
- ゼロショットまたはフェイントショットの一般化を可能にするために、トランスファー学習を適用すること。
- プロンプト工学とフェイントショットのデモを活用して、妥当で最適な計画の生成をモデルに誘導すること。
- 分野固有の計画ベンチマークとの自動検証を通じて、計画の正しさと最適性を検証すること。
実験結果
リサーチクエスチョン
- RQ1ファインチューニングされたLLMは、最小限のタスク固有の工学的アプローチで、複雑な計画領域に対し妥当なシンボリック計画を生成できるか?
- RQ2モデルの計画の正しさと最適性のパフォーマンスは、異なる計画領域でどのように変化するか?
- RQ3ある計画領域からのトランスファー学習が、構造的に異なる未学習の領域でのパフォーマンスをどの程度向上できるか?
- RQ4プロンプト設計とフェイントショット例の影響は、最適な計画の生成能力にどのような影響を与えるか?
- RQ5計画品質と推論効率の観点から、従来のシンボリック計画アルゴリズムと比較して、モデルはどのように異なるか?
主な発見
- ある設定では、Plansformer は、トワーズ・オブ・ハノイ領域における計画生成で約97%の妥当性を達成した。
- 妥当な計画のうち、約95%が最適であることが判明し、計画品質の優れたパフォーマンスを示している。
- モデルはトランスファー学習の能力を示し、複雑性の異なる多様な計画領域に効果的に一般化した。
- 従来のシンボリック計画システムと比較して、手作業による知識工学の必要性が顕著に低減された。
- 特に複雑または未学習の領域において、Plansformer はベースライン手法を上回る計画の正しさと最適性を達成した。
- フェイントショットプロンプトにおいてもモデルのパフォーマンスが安定しており、強力なフェイントショット一般化能力を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。