[论文解读] DriveLM: Driving with Graph Visual Question Answering
本文提出DriveLM,一种新颖的图结构视觉问答(GVQA)框架,将端到端自动驾驶建模为一系列相互关联的感知、预测与规划问答对。通过在新数据集(DriveLM-Data)上利用视觉语言模型(VLMs),并采用统一的VLM基础智能体(DriveLM-Agent),该方法在未见传感器配置下实现了强大的零样本泛化能力,并在推理与交互性方面优于专用驾驶架构。
We study how vision-language models (VLMs) trained on web-scale data can be integrated into end-to-end driving systems to boost generalization and enable interactivity with human users. While recent approaches adapt VLMs to driving via single-round visual question answering (VQA), human drivers reason about decisions in multiple steps. Starting from the localization of key objects, humans estimate object interactions before taking actions. The key insight is that with our proposed task, Graph VQA, where we model graph-structured reasoning through perception, prediction and planning question-answer pairs, we obtain a suitable proxy task to mimic the human reasoning process. We instantiate datasets (DriveLM-Data) built upon nuScenes and CARLA, and propose a VLM-based baseline approach (DriveLM-Agent) for jointly performing Graph VQA and end-to-end driving. The experiments demonstrate that Graph VQA provides a simple, principled framework for reasoning about a driving scene, and DriveLM-Data provides a challenging benchmark for this task. Our DriveLM-Agent baseline performs end-to-end autonomous driving competitively in comparison to state-of-the-art driving-specific architectures. Notably, its benefits are pronounced when it is evaluated zero-shot on unseen objects or sensor configurations. We hope this work can be the starting point to shed new light on how to apply VLMs for autonomous driving. To facilitate future research, all code, data, and models are available to the public.
研究动机与目标
- 解决当前端到端自动驾驶系统中泛化能力不足与人类可解释推理缺失的问题。
- 克服单轮VQA与基于目标的VQA的局限性,通过模拟人类驾驶决策的多步、逻辑依赖推理,实现更复杂的推理过程。
- 构建基准数据集(DriveLM-Data)与评估指标(DriveLM-Metrics),以支持以推理为核心的自动驾驶研究。
- 通过基于VLM的推理,实现对未见传感器配置与场景的零样本泛化。
- 通过使用自然语言作为输入与输出,提升自动驾驶车辆中人机交互的友好性。
提出的方法
- 提出图结构视觉问答(GVQA),将驾驶推理建模为感知、预测与规划问答对构成的有向图结构。
- 设计统一的基于VLM的智能体(DriveLM-Agent),通过多模态输入(图像、语言与场景上下文)联合执行GVQA与端到端驾驶策略预测。
- 构建DriveLM-Data,一个基于nuScenes与CARLA的大规模数据集,涵盖感知、预测与规划阶段的丰富多轮问答标注。
- 在问答对之间引入逻辑依赖关系,以建模对象交互与任务推进过程,支持逐步推理。
- 采用网络规模的VLM预训练,并在DriveLM-Data上通过结合问答与轨迹预测的多任务目标进行微调,训练DriveLM-Agent。
- 使用DriveLM-Metrics评估在未见传感器设置下的零样本泛化性能(例如Waymo、带/不带行人的nuScenes),测量位移误差与问答准确率。
实验结果
研究问题
- RQ1通过多轮VQA实现图结构推理,是否能提升端到端自动驾驶中的零样本泛化能力?
- RQ2将感知、预测与规划作为相互关联的问答对建模,是否相比孤立的VQA或仅轨迹预测模型,能显著提升推理与决策能力?
- RQ3在结构化问答基准上微调的视觉语言模型,能在多大程度上泛化到未见的传感器配置与场景?
- RQ4丰富且多层次的问答标注(感知 → 预测 → 规划)在自动驾驶性能提升中起到了多大作用?
- RQ5VLM能否作为原则性、可解释且可泛化的端到端驾驶系统骨干,同时提供人类友好的输出?
主要发现
- DriveLM-Agent在与最先进驾驶专用架构的对比中表现出具有竞争力的端到端驾驶性能,尤其在未见传感器配置下的零样本泛化方面表现优异。
- 该模型在未见传感器设置(如Waymo、带/不带行人的nuScenes)下展现出强大的零样本泛化能力,位移误差与问答准确率均有显著提升。
- 按问题粒度的消融研究证实,性能提升主要源于图结构中引入了预测与规划阶段的问答对,而不仅仅是感知层级的问答。
- DriveLM-Data为以推理为核心的自动驾驶研究提供了具有挑战性的基准,其在感知、预测与规划阶段均具备丰富且多层次的标注。
- 使用自然语言作为输入与输出,实现了人类可理解的决策过程,增强了自动驾驶系统中的透明度与可信度。
- DriveLM-Metrics能有效评估轨迹预测与问答准确率,支持对推理与泛化能力的全面基准测试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。