Skip to main content
QUICK REVIEW

[论文解读] Vision-based Uneven BEV Representation Learning with Polar Rasterization and Surface Estimation

Zhi Liu, Shaoyu Chen|arXiv (Cornell University)|Jul 5, 2022
Advanced Image and Video Retrieval Techniques被引用 7
一句话总结

PolarBEV 提出了一种基于视觉的、非均匀的鸟瞰图(BEV)表征学习方法,采用极坐标栅格化与迭代表面估计。通过在自车附近密集分布 BEV 网格、在远处稀疏分布,并利用嵌入分解建模角度/径向网格关联,该方法实现了实时推理(25 FPS),并在 BEV 语义分割与实例分割任务上优于先前方法。

ABSTRACT

In this work, we propose PolarBEV for vision-based uneven BEV representation learning. To adapt to the foreshortening effect of camera imaging, we rasterize the BEV space both angularly and radially, and introduce polar embedding decomposition to model the associations among polar grids. Polar grids are rearranged to an array-like regular representation for efficient processing. Besides, to determine the 2D-to-3D correspondence, we iteratively update the BEV surface based on a hypothetical plane, and adopt height-based feature transformation. PolarBEV keeps real-time inference speed on a single 2080Ti GPU, and outperforms other methods for both BEV semantic segmentation and BEV instance segmentation. Thorough ablations are presented to validate the design. The code will be released at \url{https://github.com/SuperZ-Liu/PolarBEV}.

研究动机与目标

  • 解决基于视觉的自动驾驶感知中均匀分布 BEV 网格的局限性。
  • 通过利用极坐标几何与角度/径向嵌入,更有效地建模 BEV 表征中的空间依赖性。
  • 通过基于高度的迭代变换而非深度预测,改进 2D 到 3D 特征对应关系,以提升 BEV 表征学习效果。
  • 在保持大尺度 BEV 空间高分割精度的同时,实现实时推理速度。
  • 在自动驾驶中常见的长尾、距离依赖场景下,实现高效且准确的感知。

提出的方法

  • 使用极坐标对 BEV 空间进行栅格化,使网格在自车附近密集分布、远处稀疏分布,以反映感知重要性。
  • 引入角度特异与半径特异嵌入,基于网格的三维空间位置建模极坐标网格间的关联。
  • 提出迭代 BEV 表面估计:初始化一个假设平面,并通过迭代优化网格高度以改善 2D 到 3D 的对应关系。
  • 采用基于高度的特征变换,而非深度分布,从而降低预测误差与计算成本。
  • 应用环形卷积与极坐标嵌入分解,以增强极坐标网格表征中的特征学习能力。
  • 通过由估计表面高度引导的可微变换,从图像特征重建 BEV 特征图。

实验结果

研究问题

  • RQ1是否可通过距离依赖的网格分布实现极坐标栅格化,从而在降低计算成本的同时提升 BEV 表征质量?
  • RQ2角度特异与半径特异嵌入在非均匀 BEV 网格中如何提升特征学习效果?
  • RQ3基于高度的变换是否在准确率与效率上优于基于深度的特征提升方法?
  • RQ4极坐标 BEV 网格的分辨率在多大程度上影响分割性能与内存使用?
  • RQ5迭代表面估计步骤数量如何影响推理速度与分割准确率?

主要发现

  • PolarBEV 在单张 2080Ti GPU 上实现 25 FPS 的推理速度,支持自动驾驶系统中的实时部署。
  • 在 nuScenes 基准测试中,该方法在 BEV 语义分割(IoU: 41.28%)与实例分割(PQ: 35.21%)上均优于先前最先进方法。
  • 采用 2 次迭代的迭代表面估计在准确率与速度之间达到最优平衡,优于 1 次与 6 次迭代的变体。
  • 与基线相比,极坐标嵌入分解使 IoU 提升 0.55,PQ 提升 0.36,证明其在建模网格关联方面的有效性。
  • 提高角度与径向分辨率可提升性能,最优分辨率设定为 400×100,以在准确率与内存使用间实现良好平衡。
  • 由于高度估计的数值范围更小,与基于深度的方法相比,该方法显著降低了预测误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。