Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Pretraining of 3D Features on any Point-Cloud

Zaiwei Zhang, Rohit Girdhar|arXiv (Cornell University)|Jan 7, 2021
Advanced Neural Network Applications被引用 4
一句话总结

该论文提出DepthContrast,一种用于3D点云和体素模型的自监督预训练方法,利用未标注的单视角或多视角深度图进行训练,无需3D配准或对应关系。通过在多种输入格式(点云和体素)上联合使用对比学习进行训练,该方法在9个3D识别基准上达到最先进性能,包括ScanNet检测任务中69.0%的mAP和SUNRGBD上的63.5%,优于监督预训练方法,并展现出优异的标签效率。

ABSTRACT

Pretraining on large labeled datasets is a prerequisite to achieve good performance in many computer vision tasks like 2D object recognition, video classification etc. However, pretraining is not widely used for 3D recognition tasks where state-of-the-art methods train models from scratch. A primary reason is the lack of large annotated datasets because 3D data is both difficult to acquire and time consuming to label. We present a simple self-supervised pertaining method that can work with any 3D data - single or multiview, indoor or outdoor, acquired by varied sensors, without 3D registration. We pretrain standard point cloud and voxel based model architectures, and show that joint pretraining further improves performance. We evaluate our models on 9 benchmarks for object detection, semantic segmentation, and object classification, where they achieve state-of-the-art results and can outperform supervised pretraining. We set a new state-of-the-art for object detection on ScanNet (69.0% mAP) and SUNRGBD (63.5% mAP). Our pretrained models are label efficient and improve performance for classes with few examples.

研究动机与目标

  • 为解决大规模标注3D数据集的缺乏问题,提出一种基于易于获取的单视角深度图进行自监督预训练的方法。
  • 开发一种适用于多种3D数据类型(室内/室外、单视角/多视角、不同传感器)的方法,无需3D配准或对应关系。
  • 通过在多种输入格式(如点云和体素)上联合预训练并使用对比学习,提升3D表征学习能力。
  • 证明自监督预训练可超越监督预训练,并显著提升3D识别任务在少样本学习场景下的性能。

提出的方法

  • 该方法采用对比学习框架,将每个深度图视为一个独立样本,模型学习区分同一深度图的不同增强视图。
  • 采用格式专用编码器(如点云使用PointNet,体素使用SpConv-UNet)从同一输入在不同格式下的表示中提取空间特征。
  • 通过全局最大池化和两层MLP提取全局特征,用于计算正负样本对之间的对比损失。
  • 通过联合训练同一格式内和跨格式的对比损失,促使不同输入表示之间保持一致性。
  • 在将深度图转换为点云或体素之前应用数据增强,具体策略包括随机立方体裁剪和颜色抖动。
  • 该方法对传感器类型和场景类型均不敏感,支持在多样化数据(如室内RGB-D扫描、室外LiDAR、单视角深度视频)上进行预训练。

实验结果

研究问题

  • RQ1在未标注的单视角深度图上进行自监督预训练,是否能在无需3D配准或多视角对应关系的情况下提升3D表征学习?
  • RQ2在多种输入格式(如点云和体素)上联合预训练是否能比仅在单一格式上预训练带来更好的泛化性能?
  • RQ3所提方法是否能泛化至不同类型的3D数据,包括室内和室外场景,以及RGB-D和LiDAR等各类传感器?
  • RQ4在低数据量场景下,自监督预训练的性能与监督预训练及从零开始训练相比如何?

主要发现

  • DepthContrast在ScanNet 3D目标检测基准上达到69.0% mAP的新SOTA,超越以往方法。
  • 在SUNRGBD检测基准上创下63.5% mAP的新SOTA,优于先前方法甚至超越监督预训练。
  • 在KITTI数据集上,仅使用5%的标注数据进行微调时,性能提升达20%,展现出强大的标签效率。
  • 在单视角深度图(如ScanNet-vid或Redwood-vid)上预训练的性能与在多视角配准3D场景(如ScanNet)上预训练相当,表明对输入预处理具有鲁棒性。
  • 在点云和体素表示上联合预训练相比仅在单一格式上预训练,能带来更优的下游性能,凸显多格式学习的重要性。
  • 该方法可泛化至室外LiDAR数据,如在Waymo数据集上预训练后,于KITTI自行车检测任务中表现强劲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。