Skip to main content
QUICK REVIEW

[论文解读] Panoptic-PHNet: Towards Real-Time and High-Precision LiDAR Panoptic Segmentation via Clustering Pseudo Heatmap

Jinke Li, Xiao He|arXiv (Cornell University)|May 14, 2022
Advanced Neural Network Applications被引用 5
一句话总结

Panoptic-PHNet 提出了一种实时、高精度的激光雷达全景分割框架,通过从偏移点生成聚类伪热图来消除热图分支与偏移分支之间的不一致性,采用 k-最近邻注意力机制实现精确的偏移回归,并融合细粒度体素特征与多感受野鸟瞰图(BEV)特征以实现鲁棒的特征学习,在 SemanticKITTI 和 nuScenes 数据集上实现了最先进性能,且具备实时推理速度。

ABSTRACT

As a rising task, panoptic segmentation is faced with challenges in both semantic segmentation and instance segmentation. However, in terms of speed and accuracy, existing LiDAR methods in the field are still limited. In this paper, we propose a fast and high-performance LiDAR-based framework, referred to as Panoptic-PHNet, with three attractive aspects: 1) We introduce a clustering pseudo heatmap as a new paradigm, which, followed by a center grouping module, yields instance centers for efficient clustering without object-level learning tasks. 2) A knn-transformer module is proposed to model the interaction among foreground points for accurate offset regression. 3) For backbone design, we fuse the fine-grained voxel features and the 2D Bird's Eye View (BEV) features with different receptive fields to utilize both detailed and global information. Extensive experiments on both SemanticKITTI dataset and nuScenes dataset show that our Panoptic-PHNet surpasses state-of-the-art methods by remarkable margins with a real-time speed. We achieve the 1st place on the public leaderboard of SemanticKITTI and leading performance on the recently released leaderboard of nuScenes.

研究动机与目标

  • 为解决无提案的激光雷达全景分割中热图分支与偏移分支之间的不一致性问题。
  • 通过轻量化、高效的注意力机制实现精确的偏移回归,提升实例分割精度。
  • 通过融合细粒度体素特征与多尺度鸟瞰图(BEV)特征,增强特征表示能力,以提升语义与实例分割性能。
  • 在大规模激光雷达基准上实现高精度与实时推理速度的平衡。

提出的方法

  • 通过将偏移的物体点投影到鸟瞰图(BEV)网格上,生成聚类伪热图,其中像素强度表示点密度,作为自然的实例中心指示器。
  • 引入中心分组模块,将同一实例中冗余的中心点合并,即使偏移预测不准确也能确保实例完整性。
  • 采用 k-最近邻注意力机制模块,通过关注 k 个最近邻点来建模物体点之间的局部空间交互,以低计算成本提升偏移回归精度。
  • 主干网络融合细粒度体素特征与来自类似 U-Net 结构的 2D BEV 特征,结合局部细节与全局上下文信息,增强表征能力。
  • 偏移预测头为每个物体点回归二维偏移量,这些偏移量用于在生成伪热图前对点进行位移。
  • 最终通过基于伪热图中预测的实例中心对所有物体点进行聚类,实现实例分割。

实验结果

研究问题

  • RQ1能否通过直接从偏移点生成的伪热图,消除无提案全景分割中热图与偏移分支之间的不一致性?
  • RQ2基于 k-最近邻的注意力机制模块在计算开销极低的情况下,如何提升偏移回归的准确性?
  • RQ3将细粒度体素特征与多感受野 BEV 特征融合,能在多大程度上提升全景分割性能?
  • RQ4所提方法是否能在大规模激光雷达基准上同时实现高精度与实时推理速度?

主要发现

  • Panoptic-PHNet 在公开的 SemanticKITTI 排行榜中取得第一名,全景质量(PQ)达到 61.7%,超越了以往最先进方法。
  • 在 nuScenes 数据集上,该方法实现了 PQ 61.7% 和 PQ^Th 69.3%,在近期发布的排行榜中表现领先。
  • 消融实验表明,引入细粒度体素特征可使 mIoU 提升 1.2%,PQ 提升 1.1%,凸显其对精度的关键作用。
  • k-最近邻注意力机制模块在 k=25 时达到最优性能,将端点误差(EPE)降低至 13.7 cm,显著优于 DS-Net(64.3 cm)和 Panoptic-PolarNet(44.9 cm)。
  • 定性结果表明,仅 Panoptic-PHNet 在拥挤城市场景中能正确分割三个紧密相邻的实例,验证了其在复杂场景下的鲁棒性。
  • 该方法保持了实时推理速度,在 10 FPS 门槛内运行(图 1 中的绿色区域),同时在所有评估方法中实现了最高的 PQ。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。