[论文解读] Drive as You Speak: Enabling Human-Like Interaction with Large Language Models in Autonomous Vehicles
本文提出了一种以人为中心的框架,将大型语言模型(LLMs)作为自动驾驶车辆决策的'大脑',利用感知、定位和车内监控作为'感官输入',车辆控制作为'动作'。LLMs 实现了自然语言交互、实时情境推理、零样本规划、个性化以及透明的决策解释,显著提升了复杂驾驶场景(如高速超车)下的安全性、信任度和用户体验。
The future of autonomous vehicles lies in the convergence of human-centric design and advanced AI capabilities. Autonomous vehicles of the future will not only transport passengers but also interact and adapt to their desires, making the journey comfortable, efficient, and pleasant. In this paper, we present a novel framework that leverages Large Language Models (LLMs) to enhance autonomous vehicles' decision-making processes. By integrating LLMs' natural language capabilities and contextual understanding, specialized tools usage, synergizing reasoning, and acting with various modules on autonomous vehicles, this framework aims to seamlessly integrate the advanced language and reasoning capabilities of LLMs into autonomous vehicles. The proposed framework holds the potential to revolutionize the way autonomous vehicles operate, offering personalized assistance, continuous learning, and transparent decision-making, ultimately contributing to safer and more efficient autonomous driving technologies.
研究动机与目标
- 为解决 LLMs 在感知实时驾驶环境方面的局限性,通过与车辆感知和控制模块集成。
- 使自动驾驶车辆能够理解并响应自然语言指令(如'超车前方车辆'),结合情境推理与安全检查。
- 通过让 LLMs 以通俗语言解释决策,提升透明度,增强用户信任,尤其是在复杂或罕见场景中。
- 通过记忆模块访问驾驶员偏好和过往行为,支持持续个性化。
- 展示仅使用 LLMs 和处理后的传感器数据,在动态驾驶场景中实现零样本推理的可行性。
提出的方法
- LLM 作为核心决策模块,接收来自感知、定位和车内监控系统的处理后环境数据。
- 自然语言指令由 LLM 解读,其会查询相关模块(例如,感知模块以获取车辆速度和距离)以获取上下文信息。
- LLM 通过多层推理评估交通状况、车辆动态、驾驶员状态(例如注意力水平、安全带使用情况)以及道路几何结构。
- 基于安全、效率和用户偏好,生成9步运动规划,并将动作发送至车辆控制器执行。
- 系统使用记忆模块回忆用户偏好(例如,期望的跟车距离、超车速度),以实现个性化。
- 所有决策均附带实时的自然语言解释,以增强透明度和用户信任。

实验结果
研究问题
- RQ1如何有效将 LLMs 集成到自动驾驶车辆中,以实现自然语言交互,同时确保安全性?
- RQ2LLMs 是否能在未接触过特定配置的情况下,在复杂的真实驾驶场景中实现零样本推理?
- RQ3LLMs 与车辆感知和控制模块的集成,如何提升决策透明度和用户信任?
- RQ4LLMs 在多大程度上能根据历史用户偏好和实时情境个性化驾驶行为?
- RQ5情境推理在实现高速超车等复杂操作的安全高效执行中发挥何种作用?
主要发现
- LLM 在复杂条件下成功生成了在印第安纳州双车道高速公路上的9步超车计划,包括不同车速和距离的车辆。
- 系统基于实时数据判断超车安全,尽管前方30米处有车辆以112公里/小时行驶,后方40米处有车辆以104公里/小时行驶。
- LLM 提供了详细、分步的推理说明,包括安全检查和轨迹规划,显著提升了透明度。
- 系统通过零样本推理处理了一个不熟悉的场景,且未在相同配置上进行过预先训练。
- 通过回忆驾驶员偏好(如对速度和跟车距离的舒适度),实现了个性化,从而定制超车行为。
- LLMs 与感官输入及控制器的集成,实现了无缝、直观且安全的交互模式,在灵活性和可解释性方面优于基于规则的系统。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。