[论文解读] Panoptic-PolarNet: Proposal-free LiDAR Point Cloud Panoptic Segmentation
Panoptic-PolarNet 是一种无需候选框的实时 LiDAR 点云全景分割框架,通过极坐标鸟瞰图(BEV)表示统一了语义分割与类别无关的实例聚类。通过在语义主干网络之上添加轻量级实例头,并利用多数投票融合预测结果,该方法仅增加 0.1M 参数和 0.027s 推理开销,即在 SemanticKITTI 上达到 54.1% 的 PQ,同时在 nuScenes 上取得领先结果,性能达到最先进水平。
Panoptic segmentation presents a new challenge in exploiting the merits of both detection and segmentation, with the aim of unifying instance segmentation and semantic segmentation in a single framework. However, an efficient solution for panoptic segmentation in the emerging domain of LiDAR point cloud is still an open research problem and is very much under-explored. In this paper, we present a fast and robust LiDAR point cloud panoptic segmentation framework, referred to as Panoptic-PolarNet. We learn both semantic segmentation and class-agnostic instance clustering in a single inference network using a polar Bird's Eye View (BEV) representation, enabling us to circumvent the issue of occlusion among instances in urban street scenes. To improve our network's learnability, we also propose an adapted instance augmentation technique and a novel adversarial point cloud pruning method. Our experiments show that Panoptic-PolarNet outperforms the baseline methods on SemanticKITTI and nuScenes datasets with an almost real-time inference speed. Panoptic-PolarNet achieved 54.1% PQ in the public SemanticKITTI panoptic segmentation leaderboard and leading performance for the validation set of nuScenes.
研究动机与目标
- 为自动驾驶和机器人领域中 LiDAR 点云全景分割缺乏高效、实时的解决方案提供解决方法。
- 在无需候选框的框架中统一语义分割与实例分割,避免预测头之间的冲突。
- 通过极坐标 BEV 表示利用 XY 平面中 'thing' 类别的可分性,实现鲁棒的实例聚类。
- 通过新颖的数据增强和对抗性剪枝技术提升模型的可学习性与鲁棒性。
- 在计算开销极小的前提下实现高精度,使标准 LiDAR 传感器能够实现实时推理。
提出的方法
- 该框架采用极坐标鸟瞰图(BEV)表示将 3D LiDAR 点投影,实现在二维平面上的有效实例聚类。
- 基于 PolarNet 语义分割主干网络,并添加一个受 Panoptic-DeepLab 启发的轻量级 2D 实例头以实现中心回归。
- 通过多数投票融合语义与实例预测,生成最终的全景标签,最大限度减少预测冲突。
- 采用改进的实例增强策略,包括过采样、全局和局部增强,以提升对稀有 'thing' 类别的泛化能力。
- 提出一种自适应对抗性点云剪枝方法,增强特征鲁棒性,尤其对 'stuff' 类别有显著改善。
- 引入可见性特征,以提升对高环境暴露物体(如骑行人和摩托车手)的预测性能。
实验结果
研究问题
- RQ1无候选框架构能否在 LiDAR 点云上实现高精度、实时的全景分割?
- RQ2极坐标 BEV 表示在城市场景中分离 'thing' 类别实例方面有多高效?
- RQ3新颖的数据增强与剪枝技术在多大程度上提升了模型的泛化能力与鲁棒性?
- RQ4在无候选框设置下,语义分割质量对整体全景性能的影响如何?
- RQ5能否在不显著增加计算成本的前提下,有效融合轻量级实例头与强健的语义主干网络?
主要发现
- Panoptic-PolarNet 在公开的 SemanticKITTI 全景分割排行榜上达到 54.1% 的 PQ,创下新的 SOTA 记录。
- 在 nuScenes 验证集上,其性能领先,展现出跨数据集的强大泛化能力。
- 添加实例头仅使推理时间增加 0.027s,参数量增加 0.1M,充分证明了其高效性。
- 实例过采样使 PQ 提升 2.8%,mIoU 提升 2.1%,显著改善了稀有 'thing' 类别的性能。
- 自适应对抗性剪枝稳定了语义预测,尤其对 'stuff' 类别有明显改善,带来可测量但适中的 PQ 提升。
- Oracle 消融实验表明,语义预测是主要瓶颈:当使用真实语义标签与真实实例预测结合时,PQ 可达 96.8%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。