Skip to main content
QUICK REVIEW

[论文解读] Evaluation of Large Language Models for Decision Making in Autonomous Driving

Kôtarô Tanahashi, Yuichi Inoue|arXiv (Cornell University)|Dec 11, 2023
Topic Modeling被引用 6
一句话总结

本文评估了大型语言模型(LLMs)在自动驾驶决策中的有效性,重点关注空间感知决策与交通规则遵守。通过模拟高速公路场景和真实车辆部署,发现GPT-4在准确性和推理能力方面显著优于较小的模型(如LLaMA-2和GPT-3.5),尤其在涉及冲突指令和交通规则的复杂条件下表现更优。

ABSTRACT

Various methods have been proposed for utilizing Large Language Models (LLMs) in autonomous driving. One strategy of using LLMs for autonomous driving involves inputting surrounding objects as text prompts to the LLMs, along with their coordinate and velocity information, and then outputting the subsequent movements of the vehicle. When using LLMs for such purposes, capabilities such as spatial recognition and planning are essential. In particular, two foundational capabilities are required: (1) spatial-aware decision making, which is the ability to recognize space from coordinate information and make decisions to avoid collisions, and (2) the ability to adhere to traffic rules. However, quantitative research has not been conducted on how accurately different types of LLMs can handle these problems. In this study, we quantitatively evaluated these two abilities of LLMs in the context of autonomous driving. Furthermore, to conduct a Proof of Concept (POC) for the feasibility of implementing these abilities in actual vehicles, we developed a system that uses LLMs to drive a vehicle.

研究动机与目标

  • 定量评估不同LLMs在自动驾驶中空间感知决策与交通规则遵守方面的表现。
  • 探究在高容量模型中,要求推理是否能提升LLMs的决策准确性,尤其是在复杂场景下。
  • 证明利用自然语言指令与环境输入控制真实车辆的LLMs的可行性。
  • 评估在自动驾驶系统中,模型能力、推理速度与实时适用性之间的权衡。
  • 探索LLMs在驾驶场景中伦理决策的潜力,例如对交通警察指令或冲突指令的响应。

提出的方法

  • 构建了一个模拟双车道高速公路的仿真环境,包含自车、周围车辆及交通规则。
  • 生成数据集:空间感知决策(SADM)34个样本,交通规则遵守(FTR)24个样本,综合任务(SADM&FTR)50个样本。
  • 向LLMs提供结构化输入:自车状态、周围物体(类别、x/y位置、速度)、以自然语言表述的交通规则及用户指令。
  • 指示LLMs从五种动作中选择:加速、保持速度、减速、向左变道或向右变道,并以JSON格式说明选择理由。
  • 通过API部署GPT-4,利用目标检测数据与人工指令控制真实车辆,支持动态规则注入(如根据交警信号停车)。
  • 通过动作选择准确率与推理质量评估性能,在仿真与真实场景下对比LLaMA-2、GPT-3.5与GPT-4的表现。

实验结果

研究问题

  • RQ1仅基于周围车辆的坐标与速度数据,不同LLMs在空间感知决策中的准确度如何?
  • RQ2当以自然语言提示时,LLMs在遵守交通规则(如限速与变道规定)方面的准确程度如何?
  • RQ3要求提供推理解释是否能提升LLMs在自动驾驶场景中的决策准确度?
  • RQ4LLMs(如GPT-4)能否在输入冲突时(如人工指令与交警信号冲突)优先遵循安全规则而非用户命令?
  • RQ5在延迟与计算资源限制下,LLMs在真实世界中实现端到端决策的可行性如何?

主要发现

  • GPT-4在所有任务中均达到最高准确率:仿真中SADM为96%,FTR为92%,SADM&FTR为94%,显著优于GPT-3.5与LLaMA-2。
  • 在提示中加入推理要求提升了GPT-3.5与GPT-4的决策准确率,但对LLaMA-2无显著影响,表明推理提示仅对高容量模型有效。
  • GPT-4即使在用户指令冲突的情况下,仍能正确识别并应用70 km/h限速规则,展现出强大的规则优先级处理能力。
  • 在真实车辆部署中,GPT-4保持高准确率(20个样本测试集准确率达95%),成功导航至目标锥桶,并在交警示意时正确停车。
  • LLaMA-2虽可本地部署,但准确率较低(多数任务低于50%),凸显了模型规模与性能之间的权衡。
  • 本研究证实,高容量LLMs(如GPT-4)对可靠自动驾驶决策至关重要,但通过云API实现实时部署仍面临延迟挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。