Skip to main content
QUICK REVIEW

[论文解读] FB-BEV: BEV Representation from Forward-Backward View Transformations

Zhiqi Li, Zhiding Yu|arXiv (Cornell University)|Aug 4, 2023
Advanced Vision and Imaging被引用 6
一句话总结

本文提出 FB-BEV,一种新颖的前后向视角转换模块,结合前向投影以生成稀疏、深度感知的 BEV 特征,以及深度感知的后向投影以优化稀疏区域并抑制误报。该方法通过利用深度一致性与前景感知优化,在 nuScenes 测试集上实现了新的 SOTA 指标,NDS 达到 62.4%。

ABSTRACT

View Transformation Module (VTM), where transformations happen between multi-view image features and Bird-Eye-View (BEV) representation, is a crucial step in camera-based BEV perception systems. Currently, the two most prominent VTM paradigms are forward projection and backward projection. Forward projection, represented by Lift-Splat-Shoot, leads to sparsely projected BEV features without post-processing. Backward projection, with BEVFormer being an example, tends to generate false-positive BEV features from incorrect projections due to the lack of utilization on depth. To address the above limitations, we propose a novel forward-backward view transformation module. Our approach compensates for the deficiencies in both existing methods, allowing them to enhance each other to obtain higher quality BEV representations mutually. We instantiate the proposed module with FB-BEV, which achieves a new state-of-the-art result of 62.4% NDS on the nuScenes test set. Code and models are available at https://github.com/NVlabs/FB-BEV.

研究动机与目标

  • 为解决基于前向投影的 BEV 表示中存在的稀疏性问题,该问题导致 BEV 网格利用率低且长距离检测性能差。
  • 通过引入深度一致性,减轻后向投影中的误报特征,以区分有效与无效投影。
  • 将前向与后向投影的优势统一到一个协同工作的单一视角转换模块中。
  • 通过仅聚焦于前景区域进行优化,提升推理效率与检测精度。
  • 实现在大规模 BEV 网格上实现高分辨率 BEV 感知,并保持持续的性能增益。

提出的方法

  • 提出两阶段视角转换模块:首先利用前向投影生成具有深度感知的像素到 3D 映射的稀疏 BEV 特征。
  • 通过测量 3D 点与其在 2D 图像投影之间的一致性,应用深度感知的后向投影来优化稀疏 BEV 网格。
  • 提出一种基于 3D 点与其对应 2D 投影之间深度分布距离的深度一致性度量,用于为不同投影分配可变权重。
  • 采用前景区域提议网络(FRPN)仅选择性地优化前景 BEV 网格,减少背景干扰并提升效率。
  • 使用带有离散深度值的可学习投影矩阵,在保持计算效率的同时实现密集特征填充。
  • 将优化后的 BEV 特征集成到检测头中用于 3D 目标检测,并支持端到端训练。
(a)
(a)

实验结果

研究问题

  • RQ1将前向与后向投影结合,是否能超越单一方法,显著提升 BEV 表示质量?
  • RQ2后向投影中的深度一致性如何减少由遮挡与深度模糊引起的误报特征?
  • RQ3通过 FRPN 实现的前景感知优化,在多大程度上提升了检测精度与推理效率?
  • RQ4在前向投影因稀疏性加剧而性能下降的大规模 BEV 网格上,该方法是否仍能保持或提升性能?
  • RQ5该方法是否能在无需额外深度监督的情况下,在标准基准(如 nuScenes)上实现 SOTA 性能?

主要发现

  • FB-BEV 在 nuScenes 测试集上实现了新的 SOTA 指标,NDS 达到 62.4%,优于先前方法。
  • 引入深度感知后向投影后,由深度模糊导致的纵向检测误差显著降低,可视化结果中黄色框标注的误报明显减少。
  • FRPN 同时提升了检测精度与推理速度,通过仅处理前景网格,将 VTM 延迟从 3.4ms 降低至 2.6ms。
  • 深度一致性图显示前景区域的值更高,且随高度变化,证实模型根据深度可靠性选择性地聚合特征。
  • 在更大规模的 BEV 网格上性能增益依然稳定:FB-BEV 在 400×400 BEV 网格下达到 0.406 NDS,优于 BEVDet 在相同尺度下的 0.368 NDS。
  • 该方法保持高效率,VTM 延迟仅适度增加(在 400×400 时为 6.6ms),表明其并非实时推理的性能瓶颈。
(b)
(b)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。