[论文解读] Can Large Language Models be Good Path Planners? A Benchmark and Investigation on Spatial-temporal Reasoning
本文提出了PPNL,一个用于评估大语言模型(LLMs)在网格环境中进行路径规划时的空间-时间推理能力的基准。通过少样本提示、思维链(CoT)以及ReAct风格的交替推理,GPT-4在局部任务上的成功率达到96.1%,但在长期时间推理方面仍表现不佳;微调后的模型在训练分布之外的泛化能力较差。
Large language models (LLMs) have achieved remarkable success across a wide spectrum of tasks; however, they still face limitations in scenarios that demand long-term planning and spatial reasoning. To facilitate this line of research, in this work, we propose a new benchmark, termed $ extbf{P}$ath $ extbf{P}$lanning from $ extbf{N}$atural $ extbf{L}$anguage ($ extbf{PPNL}$). Our benchmark evaluates LLMs' spatial-temporal reasoning by formulating ''path planning'' tasks that require an LLM to navigate to target locations while avoiding obstacles and adhering to constraints. Leveraging this benchmark, we systematically investigate LLMs including GPT-4 via different few-shot prompting methodologies as well as BART and T5 of various sizes via fine-tuning. Our experimental results show the promise of few-shot GPT-4 in spatial reasoning, when it is prompted to reason and act interleavedly, although it still fails to perform long-term temporal reasoning. In contrast, while fine-tuned LLMs achieved impressive results on in-distribution reasoning tasks, they struggled to generalize to larger environments or environments with more obstacles.
研究动机与目标
- 为填补评估LLMs空间-时间推理能力,特别是长时程规划任务方面的空白。
- 开发一个受控的、基于现实的基准,以隔离空间和时间推理,避免其他模态的干扰。
- 研究最先进的LLMs(如GPT-4)在使用不同提示策略进行路径规划时的表现。
- 在分布内性能和分布外泛化能力方面,比较少样本提示与微调模型(BART、T5)的表现。
- 评估当前LLMs在长时间序列上对动态避障导航进行推理的能力极限。
提出的方法
- 提出PPNL,将路径规划问题形式化为在具有障碍物和约束条件的结构化网格环境中以自然语言指令形式呈现的任务。
- 生成具有不同尺寸、障碍物数量和目标配置的合成网格环境,以控制评估条件。
- 对GPT-4应用四种提示策略:朴素少样本提示、动作与效果提示、思维链(CoT)以及ReAct(推理-行动-观察交替)提示。
- 在分布内路径规划数据上微调BART和T5模型,以评估其在新环境中的零样本泛化能力。
- 采用结构化的评估协议,成功定义为在不发生碰撞的前提下到达所有目标,轨迹有效性通过仿真进行验证。
- 通过成功率、轨迹长度以及在环境变化中的泛化能力来衡量性能。

实验结果
研究问题
- RQ1像GPT-4这样的少样本提示LLMs能否在具有障碍物的网格环境中成功完成端到端路径规划?
- RQ2与静态思维链(CoT)或朴素提示相比,交替推理(如ReAct)在提升LLMs空间-时间规划能力方面有何改善?
- RQ3微调后的LLMs(BART、T5)在训练分布之外的更大或更复杂环境中,其泛化能力在多大程度上得以实现?
- RQ4当规划序列更长或障碍物密度更高时,LLMs的性能是否会显著下降?
- RQ5LLMs能否维持长期时间推理,还是依赖频繁的环境反馈来纠正短视决策?
主要发现
- ReAct提示使GPT-4的成功率提升至96.1%,显著优于朴素少样本提示,证明了交替推理和环境反馈的价值。
- 与朴素少样本提示相比,动作与效果提示使成功率提高了21.5%,表明追踪状态变化可改善即时决策能力。
- 与动作与效果提示相比,思维链提示带来了3%的性能提升,表明结构化推理可增强规划质量。
- 尽管在分布内任务中表现优异,微调后的BART和T5模型在更大网格或障碍物更多的环境中均无法实现泛化。
- 即使使用ReAct提示,GPT-4仍仅能前瞻几步,并频繁修正路径,表明其缺乏长期时间推理能力。
- 朴素提示导致生成随机的动作序列,证实未引导的LLMs无法理解路径规划任务或环境结构。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。