Skip to main content
QUICK REVIEW

[论文解读] V2X-ViT: Vehicle-to-Everything Cooperative Perception with Vision Transformer

Runsheng Xu, Xiang Hao|arXiv (Cornell University)|Mar 20, 2022
Advanced Neural Network Applications被引用 10
一句话总结

本文提出 V2X-ViT,一种用于车联网协同感知的统一视觉Transformer架构,能够联合处理异构智能体(车辆与基础设施)并鲁棒地融合多源、噪声大且异步共享的视觉特征。通过在端到端可训练框架中集成异构多智能体自注意力与多尺度窗口注意力模块,该方法在恶劣、嘈杂条件下仍实现了SOTA的3D目标检测性能,相较于单智能体基线模型实现21.2%的平均精度(AP)提升。

ABSTRACT

In this paper, we investigate the application of Vehicle-to-Everything (V2X) communication to improve the perception performance of autonomous vehicles. We present a robust cooperative perception framework with V2X communication using a novel vision Transformer. Specifically, we build a holistic attention model, namely V2X-ViT, to effectively fuse information across on-road agents (i.e., vehicles and infrastructure). V2X-ViT consists of alternating layers of heterogeneous multi-agent self-attention and multi-scale window self-attention, which captures inter-agent interaction and per-agent spatial relationships. These key modules are designed in a unified Transformer architecture to handle common V2X challenges, including asynchronous information sharing, pose errors, and heterogeneity of V2X components. To validate our approach, we create a large-scale V2X perception dataset using CARLA and OpenCDA. Extensive experimental results demonstrate that V2X-ViT sets new state-of-the-art performance for 3D object detection and achieves robust performance even under harsh, noisy environments. The code is available at https://github.com/DerrickXuNu/v2x-vit.

研究动机与目标

  • 为解决单辆车辆感知存在的遮挡与视场受限等局限性,通过车辆与道路基础设施之间的协同感知实现突破。
  • 设计一种统一的、端到端可训练的Transformer框架,以处理车联网智能体的异质性,包括传感器模态差异、安装高度差异以及噪声水平差异。
  • 通过新颖的注意力机制与延迟感知的位置编码,缓解车联网通信中异步数据共享、GPS定位误差与时间延迟带来的挑战。
  • 构建一个大规模、真实的仿真数据集,以捕捉真实世界的通信缺陷,用于基准化车联网感知系统。

提出的方法

  • 提出 V2X-ViT,一种视觉Transformer,其层间交替使用异构多智能体自注意力(HMSA)与多尺度窗口自注意力(MSwin),以融合异构智能体间的特征,并捕捉局部与全局空间关系。
  • 引入异构多智能体自注意力模块,显式建模智能体类型(车辆、基础设施)及其相互连接关系,实现对异质特征的自适应融合。
  • 采用多尺度窗口注意力机制,通过并行使用不同分辨率的窗口,提升对定位误差与特征错位的鲁棒性。
  • 引入延迟感知位置编码,以应对异步车联网通信中的时间延迟,提升特征的时间对齐能力。
  • 采用统一的Transformer架构,端到端联合优化所有组件,实现在噪声与不确定性条件下的鲁棒特征融合。
  • 设计压缩与通信流水线,实现智能体间中间深层特征的传输,在降低带宽消耗的同时保持检测性能。

实验结果

研究问题

  • RQ1统一的视觉Transformer架构能否在车联网协同感知中有效融合来自车辆与基础设施的异质视觉特征?
  • RQ2在异质车联网设置下,所提出的异构多智能体自注意力机制相较于标准自注意力机制,在特征融合方面有何改进?
  • RQ3多尺度窗口注意力机制在多大程度上增强了对定位误差与时间延迟的鲁棒性?
  • RQ4延迟感知位置编码在异步通信条件下如何提升模型性能?
  • RQ5在真实世界中存在噪声与异步通信的设置下,V2X-ViT相较于单智能体方法与现有协同感知方法,性能提升幅度如何?

主要发现

  • 在所提出的 V2XSet 数据集上,V2X-ViT 相较于单智能体基线模型,在3D目标检测的平均精度(AP)上实现了21.2%的绝对提升。
  • 在噪声通信环境下,该模型优于领先的中间特征融合方法(包括 F-Cooper、OPV2V、V2VNet 和 DiscoNet),AP 提升至少7.3%。
  • 在高度遮挡与密集交通场景(如场景7)中,V2X-ViT 保持了高检测精度,漏检更少,回归偏移更小。
  • 注意力可视化结果表明,自车智能体在遮挡区域更关注基础设施提供的特征,验证了模型利用基础设施更广、更少遮挡视野的能力。
  • 该模型对不同数据传输大小与时间延迟具有鲁棒性,在采用均匀延迟分布建模的真实通信不确定性下,性能保持稳定。
  • 所提出的 V2XSet 数据集支持对车联网感知系统的现实评估,包含真实世界通信缺陷,如可变延迟与数据包丢失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。