Skip to main content
QUICK REVIEW

[论文解读] ProposalContrast: Unsupervised Pre-training for LiDAR-based 3D Object Detection

Junbo Yin, Dingfu Zhou|arXiv (Cornell University)|Jul 26, 2022
Advanced Neural Network Applications被引用 7
一句话总结

ProposalContrast 提出了一种用于基于激光雷达的3D目标检测的新型无监督预训练框架,通过对比区域提议而非场景或单个点/体素来学习鲁棒的3D表征。它使用交叉注意力编码器来建模提议内部的几何关系,并联合优化提议间判别与聚类间分离,从而在KITTI、Waymo和ONCE等多个3D检测器与数据集上实现了最先进(SOTA)的性能提升。

ABSTRACT

Existing approaches for unsupervised point cloud pre-training are constrained to either scene-level or point/voxel-level instance discrimination. Scene-level methods tend to lose local details that are crucial for recognizing the road objects, while point/voxel-level methods inherently suffer from limited receptive field that is incapable of perceiving large objects or context environments. Considering region-level representations are more suitable for 3D object detection, we devise a new unsupervised point cloud pre-training framework, called ProposalContrast, that learns robust 3D representations by contrasting region proposals. Specifically, with an exhaustive set of region proposals sampled from each point cloud, geometric point relations within each proposal are modeled for creating expressive proposal representations. To better accommodate 3D detection properties, ProposalContrast optimizes with both inter-cluster and inter-proposal separation, i.e., sharpening the discriminativeness of proposal representations across semantic classes and object instances. The generalizability and transferability of ProposalContrast are verified on various 3D detectors (i.e., PV-RCNN, CenterPoint, PointPillars and PointRCNN) and datasets (i.e., KITTI, Waymo and ONCE).

研究动机与目标

  • 为解决现有无监督预训练方法在3D目标检测中的局限性,这些方法要么丢失局部物体细节(场景级),要么过度强调细粒度点(点/体素级)。
  • 提出一种新的预训练范式,以区域提议作为表征学习的基本单元,更好地契合3D检测的实例与物体中心特性。
  • 提升自监督表征在多样化3D检测器与大规模激光雷达数据集上的泛化能力与迁移能力。
  • 设计一种方法,通过双重掩码任务捕捉实例特定与类别不变特征。

提出的方法

  • 提出一种基于提议的对比学习框架,通过球形采样从每个激光雷达点云中提取区域提议,并结合数据增强。
  • 采用基于交叉注意力的提议编码器,建模每个提议内点之间的几何关系,增强局部结构表征。
  • 引入两项联合掩码任务:提议间判别(IPD)用于学习实例特定特征,聚类间分离(ICS)用于利用Sinkhorn-Knopp聚类生成的伪标签学习类别不变特征。
  • 使用双分支对比损失,结合IPD与ICS目标,优化判别性与泛化性表征。
  • 通过随机旋转与点云掩码进行数据增强,生成对比学习的正样本视图。
  • 在下游3D检测任务中,仅使用少量标注数据对预训练主干网络进行微调。

实验结果

研究问题

  • RQ1基于提议的表征学习是否能优于场景级与点/体素级的预训练方法?
  • RQ2在提议内部建模几何关系如何提升3D检测的特征质量?
  • RQ3联合优化提议间判别与聚类间分离对表征质量有何影响?
  • RQ4该方法在不同3D检测器与数据集上的鲁棒性如何?
  • RQ5哪些消融设置(如提议数量、半径、聚类策略)能获得最佳性能?

主要发现

  • 在CenterPoint上微调Waymo 20%训练集时,ProposalContrast在mAP/mAPH上达到62.75/60.13,显著优于随机初始化基线的59.63/56.96。
  • 注意力提议编码器相比MaxPooling基线将mAPH提升0.81分,证明建模内部几何结构的重要性。
  • IPD与ICS的联合优化表现最佳,当移除Sinkhorn-Knopp聚类时mAPH下降2.44分,凸显其关键作用。
  • ICS使用128个聚类优于256个聚类,最优提议半径为1.0m,每个提议包含2048个点。
  • 该方法在多种检测器上具有泛化能力:PV-RCNN、CenterPoint、PointPillars与PointRCNN,在KITTI、Waymo与ONCE上均表现出强迁移能力。
  • 消融实验表明,仅使用IPD可使mAPH提升2.60分,仅使用ICS可提升1.74分,两者结合获得最高增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。