Skip to main content
QUICK REVIEW

[論文レビュー] Can Large Language Models be Good Path Planners? A Benchmark and Investigation on Spatial-temporal Reasoning

Mohamed Aghzal, Erion Plaku|arXiv (Cornell University)|Oct 5, 2023
Natural Language Processing Techniques被引用数 6
ひとこと要約

本稿では、グリッド環境における経路計画のための空間的・時間的推論に関する大規模言語モデル(LLM)の評価を目的としたベンチマークPPNLを紹介する。少数の例提示(few-shot prompting)、思考の流れ(chain-of-thought)、およびReAct形式の相互作用的推論を用いて、GPT-4は局所的タスクで96.1%の成功率を達成したが、長期的な時間的推論には失敗している。微調整済みモデルは訓練分布を超えて一般化する能力に欠ける。

ABSTRACT

Large language models (LLMs) have achieved remarkable success across a wide spectrum of tasks; however, they still face limitations in scenarios that demand long-term planning and spatial reasoning. To facilitate this line of research, in this work, we propose a new benchmark, termed $ extbf{P}$ath $ extbf{P}$lanning from $ extbf{N}$atural $ extbf{L}$anguage ($ extbf{PPNL}$). Our benchmark evaluates LLMs' spatial-temporal reasoning by formulating ''path planning'' tasks that require an LLM to navigate to target locations while avoiding obstacles and adhering to constraints. Leveraging this benchmark, we systematically investigate LLMs including GPT-4 via different few-shot prompting methodologies as well as BART and T5 of various sizes via fine-tuning. Our experimental results show the promise of few-shot GPT-4 in spatial reasoning, when it is prompted to reason and act interleavedly, although it still fails to perform long-term temporal reasoning. In contrast, while fine-tuned LLMs achieved impressive results on in-distribution reasoning tasks, they struggled to generalize to larger environments or environments with more obstacles.

研究の動機と目的

  • LLMの空間的・時間的推論能力を評価する分野におけるギャップ、特に長時間スパンの計画タスクに関して、その評価を補完すること。
  • 空間的および時間的推論を混同要因なしに分離する、制御された、実世界に根ざしたベンチマークの開発。
  • GPT-4のような最先端LLMが、さまざまなプロンプティング戦略を用いて経路計画にどのように対処するかを調査すること。
  • 少数の例提示プロンプティングと微調整済みモデル(BART、T5)の、分布内性能および分布外一般化の観点からの比較。
  • 現在のLLMが、延々と続くシーケンスにわたり、動的で障害物回避型ナビゲーションについて推論する能力の限界を評価すること。

提案手法

  • 障害物や制約を伴う構造化されたグリッド環境において、経路計画を自然言語の指示タスクとして定式化するPPNLを提案する。
  • 評価条件を制御するため、サイズ、障害物数、ゴール設定が異なる合成グリッド環境を生成する。
  • GPT-4に4つのプロンプティング戦略を適用する:ナード・フェイシュット(naive few-shot)、アクションと効果のプロンプティング、思考の流れ(CoT)、ReAct(推論・行動・観測の反復的統合)。
  • BARTおよびT5モデルを分布内経路計画データで微調整し、新しい環境へのゼロショット一般化能力を評価する。
  • 成功は、衝突を伴わずすべてのゴールに到達した場合に定義され、軌道の有効性はシミュレーションで確認する、構造化された評価プロトコルを用いる。
  • 成功率、軌道長、環境変化にわたる一般化能力を測定する。
Figure 1: Overview of the data generation process.
Figure 1: Overview of the data generation process.

実験結果

リサーチクエスチョン

  • RQ1GPT-4のような少々の例提示プロンプティングを用いたLLMは、障害物を伴うグリッド環境で、エンドツーエンドの経路計画を成功裏に実行できるか?
  • RQ2例えばReActのような相互作用的推論は、静的CoTやナード・プロンプティングに比べ、LLMの空間的・時間的計画能力をどのように向上させるか?
  • RQ3微調整済みLLM(BART、T5)は、訓練分布を超えて、より大きな環境やより複雑な環境に一般化できるか?
  • RQ4計画対象のシーケンスが長くなる、もしくは障害物密度が高い環境では、LLMの性能が著しく低下するか?
  • RQ5LLMは長期的な時間的推論を維持できるか、それとも短絡的な意思決定を是正するために頻繁な環境フィードバックに依存しているか?

主な発見

  • ReActプロンプティングにより、GPT-4の成功率は96.1%に向上し、ナード・フェイシュットプロンプティングや他の手法を大きく上回った。これは、相互作用的推論と環境フィードバックの価値を示している。
  • アクションと効果のプロンプティングは、ナード・フェイシュットプロンプティングに比べ21.5%の成功率向上を示し、状態変化の追跡が即時の意思決定を向上させることを示した。
  • 思考の流れ(CoT)プロンプティングは、アクションと効果プロンプティングに比べ3%の改善をもたらした。これは、構造化された推論が計画の質を向上させることを示している。
  • 分布内タスクでは高い成功率を示したが、微調整済みのBARTおよびT5モデルは、より大きなグリッドや障害物の多い環境への一般化に失敗した。
  • ReActを用いたGPT-4でさえ、数ステップ先までしか計画せず、頻繁に経路を修正していることから、長期的な時間的推論能力に欠けていることが示された。
  • ナード・プロンプティングでは、ランダムな行動シーケンスが生じ、指導のないLLMが経路計画タスクや環境構造を正しく理解できないことが確認された。
Figure 2: Overview of the most common errors produced by each prompting method for few-shot GPT-4. We show the shortcomings of each method and how other methods improve on that aspect.
Figure 2: Overview of the most common errors produced by each prompting method for few-shot GPT-4. We show the shortcomings of each method and how other methods improve on that aspect.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。