Skip to main content
QUICK REVIEW

[论文解读] LaRa: Latents and Rays for Multi-Camera Bird's-Eye-View Semantic Segmentation

Florent Bartoccioni, Éloi Zablocki|arXiv (Cornell University)|Jun 27, 2022
Advanced Neural Network Applications参考文献 37被引用 5
一句话总结

LaRa 提出了一种基于 Transformer 的编码器-解码器模型,用于多相机鸟瞰图(BEV)语义分割,通过交叉注意力将特征融合为一组紧凑的潜在表示(latents),随后通过第二次交叉注意力重建全分辨率 BEV 图像。该方法通过利用射线嵌入(ray embeddings)进行几何引导,避免了易出错的深度估计或密集的 2D 到 BEV 映射,从而在 nuScenes 数据集上实现了最先进性能。

ABSTRACT

Recent works in autonomous driving have widely adopted the bird's-eye-view (BEV) semantic map as an intermediate representation of the world. Online prediction of these BEV maps involves non-trivial operations such as multi-camera data extraction as well as fusion and projection into a common topview grid. This is usually done with error-prone geometric operations (e.g., homography or back-projection from monocular depth estimation) or expensive direct dense mapping between image pixels and pixels in BEV (e.g., with MLP or attention). In this work, we present 'LaRa', an efficient encoder-decoder, transformer-based model for vehicle semantic segmentation from multiple cameras. Our approach uses a system of cross-attention to aggregate information over multiple sensors into a compact, yet rich, collection of latent representations. These latent representations, after being processed by a series of self-attention blocks, are then reprojected with a second cross-attention in the BEV space. We demonstrate that our model outperforms the best previous works using transformers on nuScenes. The code and trained models are available at https://github.com/valeoai/LaRa

研究动机与目标

  • 解决现有 BEV 语义分割方法在依赖密集 2D 到 BEV 映射或深度估计时存在的计算与几何效率低下问题。
  • 通过将处理过程与输入输出分辨率解耦,实现对模型内存与计算量的精确控制。
  • 通过在注意力机制中引入射线嵌入以编码几何先验,提升多视角特征融合效果。
  • 在无需昂贵上采样或易出错的几何投影的前提下,实现高分辨率 BEV 预测。
  • 证明基于潜在表示的注意力机制能够自然地将多个相机视角拼接在一起,保持强空间一致性。

提出的方法

  • 模型使用共享的 CNN 提取多相机图像特征,随后将这些特征与由相机标定参数导出的射线嵌入相连接,以编码几何关系。
  • 在图像特征与可学习的 256 个潜在向量之间应用交叉注意力,将多视角信息聚合为紧凑的高层表示。
  • 通过 L 个自注意力块处理潜在表示,以优化跨视角与视角内关系。
  • 通过第二次交叉注意力,使用与 BEV 网格位置对齐的查询,将优化后的潜在表示投影回全分辨率 BEV 空间。
  • 最后通过轻量级 CNN 头部对最终的 BEV 图像进行细化,以提升定位与边界精度。
  • 射线嵌入被设计为编码图像像素与 BEV 网格单元之间的方向与空间关系,引导跨视角注意力。

实验结果

研究问题

  • RQ1紧凑的潜在表示能否替代密集的 2D 到 BEV 特征映射,同时保持或提升分割精度?
  • RQ2通过射线嵌入引入几何先验,对 BEV 语义分割中的多相机融合有何影响?
  • RQ3在无显式几何监督的情况下,潜在表示的交叉注意力机制在多视角自然拼接方面能达到何种程度?
  • RQ4消除深度估计是否能提升在复杂条件下的 BEV 预测鲁棒性与准确性?
  • RQ5潜在表示的数量与注意力头的数量如何影响模型对长距离及多方向场景结构的关注能力?

主要发现

  • LaRa 在 nuScenes 数据集的车辆语义分割任务中实现了最先进性能,优于先前的基于 Transformer 的模型(如 CVT 和 Lift-Splat)。
  • 即使在远距离与遮挡区域,模型仍保持高精度,边界定位优于 Lift-Splat,且比在所有可见性级别上训练的模型更少出现幻觉现象。
  • 注意力可视化结果表明,模型在相机视角之间学习到了连续且具有方向性的注意力模式,其中一个注意力头聚焦于约 90° 的视场角,而所有头的平均注意力覆盖了场景的一半。
  • 射线嵌入显著提升了多视角拼接效果,注意力图与相机之间的几何对应关系高度对齐。
  • 由于潜在表示处理与 BEV 分辨率解耦,模型在计算开销极低的情况下仍保持强大性能。
  • 消融实验表明,潜在表示的数量与射线嵌入的使用对最优性能至关重要,其中移除射线嵌入导致 mIoU 下降 2.1%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。