[论文解读] V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models
本文提出 V2X-VLM,一种端到端的车路协同自动驾驶框架,利用大规模视觉语言模型(VLMs)融合来自车辆摄像头、基础设施传感器和文本上下文的多模态数据,以提升情境感知能力和轨迹规划性能。该方法在 DAIR-V2X 数据集上实现了 1.40m 的平均 L2 误差,显著优于先前方法。
Vehicle-to-everything (V2X) cooperation has emerged as a promising paradigm to overcome the perception limitations of classical autonomous driving by leveraging information from both ego-vehicle and infrastructure sensors. However, effectively fusing heterogeneous visual and semantic information while ensuring robust trajectory planning remains a significant challenge. This paper introduces V2X-VLM, a novel end-to-end (E2E) cooperative autonomous driving framework based on vision-language models (VLMs). V2X-VLM integrates multiperspective camera views from vehicles and infrastructure with text-based scene descriptions to enable a more comprehensive understanding of driving environments. Specifically, we propose a contrastive learning-based mechanism to reinforce the alignment of heterogeneous visual and textual characteristics, which enhances the semantic understanding of complex driving scenarios, and employ a knowledge distillation strategy to stabilize training. Experiments on a large real-world dataset demonstrate that V2X-VLM achieves state-of-the-art trajectory planning accuracy, significantly reducing L2 error and collision rate compared to existing cooperative autonomous driving baselines. Ablation studies validate the contributions of each component. Moreover, the evaluation of robustness and efficiency highlights the practicality of V2X-VLM for real-world deployment to enhance overall autonomous driving safety and decision-making.
研究动机与目标
- 为解决当前端到端自动驾驶系统在处理复杂动态驾驶环境时的局限性,通过整合车辆和基础设施的多模态数据。
- 通过使用处理视觉和文本输入的大规模视觉语言模型(VLMs),提升协同自动驾驶中的情境感知能力和决策能力。
- 通过综合多模态数据融合,提升真实场景下轨迹规划的精度和鲁棒性。
- 通过常识推理和上下文理解,使系统能够泛化于罕见和复杂的都市场景,从而降低长尾故障率。
提出的方法
- 该框架采用大规模视觉语言模型(VLM)作为核心骨干网络,处理并融合多模态输入,包括车载摄像头图像、基础设施传感器数据以及环境的文本描述。
- 将车辆和基础设施摄像头的视觉特征与文本上下文(如交通标志、道路状况)相结合,生成统一的、上下文感知的驾驶场景表征。
- 在 DAIR-V2X 数据集上对 VLM 进行端到端微调,以在单一统一流程中联合优化感知、推理和轨迹规划。
- 系统使用基于 Transformer 的解码器,直接从融合的多模态嵌入中生成路径点序列,将轨迹规划视为语言生成任务。
- 通过提取并传输关键特征而非全分辨率图像,优化数据传输,降低带宽消耗,同时保留关键信息。
- 通过采用高效的 VLM 架构和面向硬件的设计原则,支持实时推理,在性能与通信成本之间实现平衡。
实验结果
研究问题
- RQ1大规模视觉语言模型能否有效整合多模态输入(视觉、文本和基础设施数据),以提升协同自动驾驶中的情境感知能力?
- RQ2在多样化驾驶场景下,端到端的 V2X-VLM 与现有 SOTA 方法相比,在轨迹规划精度和鲁棒性方面表现如何?
- RQ3将文本上下文与视觉数据融合,在复杂城市环境中在多大程度上能提升决策能力并降低错误率?
- RQ4在 V2X 通信中,使用高保真视觉数据与压缩特征表示时,传输成本与规划精度之间的权衡如何?
主要发现
- V2X-VLM 在 DAIR-V2X 数据集上的轨迹预测平均 L2 误差为 1.40m,显著优于次优方法 UniV2X 的 3.43m。
- 在所有评估的时间间隔(2.5s、3.5s、4.5s)中,与最接近的基线方法(UniV2X)相比,L2 误差降低超过 50%。
- 尽管传输成本较高($1.24 \times 10^7$ BPS),V2X-VLM 通过全面的多模态融合实现了更优的精度,维持了有利的权衡。
- 该模型在多样化且复杂的驾驶场景中表现出稳健性能,包括十字路口、行人横穿区域以及恶劣天气条件。
- 通过 VLM 集成文本上下文显著增强了推理与泛化能力,尤其在仅靠视觉线索不足的长尾场景中表现突出。
- 该框架在可扩展性和实际部署方面展现出强大潜力,尤其在通过特征提取进一步优化数据传输后。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。