Skip to main content
QUICK REVIEW

[论文解读] Can LLMs plan paths in the real world?

Wanyi Chen, Meng-Wen Su|arXiv (Cornell University)|Nov 26, 2024
Private Equity and Venture CapitalBusiness, Management and Accounting被引用 3
一句话总结

本研究评估了三种大型语言模型——GPT-4、Gemini 和 Mistral——在六种不同现实场景(包括城市、郊区和农村环境)中的实际路径规划能力。尽管采用了多种提示策略,所有模型均产生了大量错误,暴露出其在实际导航任务中存在显著不可靠性。

ABSTRACT

As large language models (LLMs) increasingly integrate into vehicle navigation systems, understanding their path-planning capability is crucial. We tested three LLMs through six real-world path-planning scenarios in various settings and with various difficulties. Our experiments showed that all LLMs made numerous errors in all scenarios, revealing that they are unreliable path planners. We suggest that future work focus on implementing mechanisms for reality checks, enhancing model transparency, and developing smaller models.

研究动机与目标

  • 评估大型语言模型(LLMs)是否能够在真实环境中可靠地生成准确的路径规划指令。
  • 在包括城市、郊区和农村在内的多样化真实环境中评估 LLMs 的表现,涵盖不同复杂度的场景。
  • 比较 LLMs 在逐项导航(turn-by-turn)与基于视觉地标导航(VLN)两种方式下的性能表现。
  • 识别 LLM 生成导航指令中的系统性错误,并理解其在真实情境下的根本原因。
  • 倡导提升模型透明度、引入现实校验机制,并推动开发更小、更可靠的模型以用于导航任务。

提出的方法

  • 在三个城市、郊区和农村场景中,以乔治梅森大学为起点,开展了六项真实路径规划实验。
  • 采用逐项导航(TbT)和基于视觉地标导航(VLN)两种提示策略,测试了三种 LLMs——GPT-4、Gemini 和 Mistral 7B。
  • 设计提示以生成分步驾驶指引或基于地标的位置导航提示,模拟真实车辆或行人导航行为。
  • 收集并分析模型输出,评估其事实准确性、路线逻辑性、地标一致性以及时间规划能力。
  • 通过后续查询测试模型对实时数据限制的认知能力,以及验证外部事实的能力。
  • 评估模型在时间压力下,以及面对矛盾或错误信息时的行为表现。
(a) GPT’s path
(a) GPT’s path

实验结果

研究问题

  • RQ1LLMs 是否能够在真实世界的城市、郊区和农村环境中生成准确、安全且可执行的逐项导航指令?
  • RQ2在复杂或标识稀少的环境中,LLMs 在基于视觉地标导航(VLN)中的表现,相较于传统 GPS 式路径规划如何?
  • RQ3LLMs 在多大程度上能够识别并适当地响应现实世界约束,如交通状况、时间窗口和营业时间?
  • RQ4在真实世界场景中,LLM 生成的导航计划最常出现哪些类型的错误——空间错误、事实错误还是逻辑错误?
  • RQ5模型规模与架构(例如 GPT-4 与 Mistral 7B)在真实世界路径规划中的可靠性与一致性方面,有何影响?

主要发现

  • 在所有测试的真实场景中,三种 LLMs——GPT-4、Gemini 和 Mistral——均出现了多重关键性错误,包括错误的路线顺序和错误的假设。
  • GPT-4 曾错误声称 Shot Tower State Park 位于内华达州,后经追问更正为弗吉尼亚州,表明其缺乏事实依据。
  • Mistral 7B 为位于弗吉尼亚州的一座公园生成了从弗吉尼亚州到内华达州的 2,500 英里路线,暴露出严重的空间推理缺陷。
  • LLMs 频繁未能验证实时运营数据(如公园开放时间),且无法访问实时信息以确认节假日安排。
  • 即使在后续追问下,模型也常常无法纠正错误,或未能承认其在获取当前数据方面的局限性。
  • 本研究结论认为,由于幻觉现象、事实基础薄弱以及缺乏现实校验机制,LLMs 当前尚不可靠,无法用于真实世界路径规划。
(b) Gemini’s path
(b) Gemini’s path

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。