[论文解读] Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving
本文提出了一种新颖的多模态大语言模型架构,通过将对象级向量表示与预训练语言模型融合,实现可解释的、基于推理的自动驾驶。通过在向量描述数据上进行预训练,并在基于强化学习生成的驾驶场景中衍生出的160k问答数据集上进行微调,该大语言模型驱动系统在驾驶问答和动作预测任务中表现出色,平均GPT评分较基线模型高出9.1%。
Large Language Models (LLMs) have shown promise in the autonomous driving sector, particularly in generalization and interpretability. We introduce a unique object-level multimodal LLM architecture that merges vectorized numeric modalities with a pre-trained LLM to improve context understanding in driving situations. We also present a new dataset of 160k QA pairs derived from 10k driving scenarios, paired with high quality control commands collected with RL agent and question answer pairs generated by teacher LLM (GPT-3.5). A distinct pretraining strategy is devised to align numeric vector modalities with static LLM representations using vector captioning language data. We also introduce an evaluation metric for Driving QA and demonstrate our LLM-driver's proficiency in interpreting driving scenarios, answering questions, and decision-making. Our findings highlight the potential of LLM-based driving action generation in comparison to traditional behavioral cloning. We make our benchmark, datasets, and model available for further exploration.
研究动机与目标
- 通过将大语言模型作为推理‘大脑’集成,提升自动驾驶系统在可解释性和分布外推理方面的能力。
- 实现对象级数值向量模态(如速度、距离)与预训练大语言模型的有效融合,以实现更丰富的上下文理解。
- 开发一种可扩展的、自动化的流水线,利用强化学习智能体和GPT-3.5生成高质量的驾驶场景问答对。
- 建立一个新的驾驶问答(DQA)基准,采用基于大语言模型的评估方式,并提供可复现的基线模型。
- 探索仅使用向量和文本输入实现端到端大语言模型驱动策略学习的可行性。
提出的方法
- 采用两阶段预训练策略,通过从对象级向量生成文本描述(即向量描述),将数值型向量模态与大语言模型表示对齐。
- 使用自定义的2D驾驶模拟器生成多样化的驾驶场景,强化学习智能体提供专家控制指令。
- 使用教师大语言模型(GPT-3.5)基于语言化后的向量观测生成160k个条件问答对。
- 大语言模型架构采用适配器融合向量与文本模态,实现对场景上下文的联合推理。
- 评估使用GPT-3.5作为评分器,评估测试集上的答案质量,同时辅以人工标注验证以确保可靠性。
- 最终的大语言模型驱动模型在问答数据集上进行微调,用于驾驶动作预测和场景理解。
实验结果
研究问题
- RQ1能否通过文本描述预训练,将对象级向量模态有效嵌入到预训练大语言模型中?
- RQ2与传统的行为克隆方法相比,基于大语言模型的智能体在驾驶问答和动作预测任务中的表现如何?
- RQ3在向量描述上进行预训练在多大程度上提升了大语言模型对驾驶场景的推理能力?
- RQ4基于大语言模型的系统是否能在分布外驾驶场景中实现良好泛化,同时具备改进的可解释性?
- RQ5GPT-3.5作为人机协同评估器,在驾驶问答任务中是否有效?
主要发现
- 经过预训练的大语言模型驱动系统在驾驶问答基准测试中,平均GPT评分达到8.39,较未预训练版本提升9.1%。
- 人工标注评估确认了模型性能,平均得分为7.71,与GPT评分结果高度一致。
- 模型显著优于恒定答案和随机答案基线,其GPT评分分别为2.92和3.88。
- 预训练策略有效实现了向量模态与大语言模型表示的对齐,从而提升了在驾驶场景中的上下文推理能力。
- 大语言模型驱动系统展现出强大的泛化能力和可解释性,表明其在自动驾驶系统中具备实现类AGI推理的潜力。
- 本研究首次建立了端到端的大语言模型驱动框架,涵盖向量模态融合、数据集构建和评估流水线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。