Skip to main content
QUICK REVIEW

[论文解读] 3D Feature Prediction for Masked-AutoEncoder-Based Point Cloud Pretraining

Siming Yan, Yuqi Yang|arXiv (Cornell University)|Apr 14, 2023
3D Shape Modeling and Analysis被引用 5
一句话总结

本文提出了一种用于3D点云自监督预训练的新型掩码自编码框架,该框架在掩码点处预测内在几何特征——表面法向量和表面变化,而非重建点的位置。通过使用与编码器无关的基于查询和交叉注意力的解码器,该方法在3D分类和部件分割任务上实现了最先进性能,表明特征重建比位置恢复更为有效。

ABSTRACT

Masked autoencoders (MAE) have recently been introduced to 3D self-supervised pretraining for point clouds due to their great success in NLP and computer vision. Unlike MAEs used in the image domain, where the pretext task is to restore features at the masked pixels, such as colors, the existing 3D MAE works reconstruct the missing geometry only, i.e, the location of the masked points. In contrast to previous studies, we advocate that point location recovery is inessential and restoring intrinsic point features is much superior. To this end, we propose to ignore point position reconstruction and recover high-order features at masked points including surface normals and surface variations, through a novel attention-based decoder which is independent of the encoder design. We validate the effectiveness of our pretext task and decoder design using different encoder structures for 3D training and demonstrate the advantages of our pretrained networks on various point cloud analysis tasks.

研究动机与目标

  • 为解决现有3D掩码自编码器在预训练中优先重建掩码点位置而非内在几何特征的局限性。
  • 通过将掩蔽任务从几何重建转变为高阶特征预测,改进3D自监督表征学习。
  • 设计一种与编码器解耦的解码器架构,实现鲁棒的特征恢复且避免位置信息泄露。
  • 在多种3D主干网络和下游任务上验证内在特征预测的有效性。

提出的方法

  • 该方法将点位置重建替换为在掩码点处预测表面法向量和表面变化作为掩蔽任务。
  • 引入基于注意力的解码器,使用掩码点作为查询,并通过交叉注意力和自注意力从编码器输出生成特征。
  • 解码器与编码器解耦,可兼容多种3D主干架构,如稀疏CNN、基于点的网络和Transformer。
  • 解码器使用交叉注意力关注编码特征,利用自注意力在掩码点之间传播上下文信息,实现一致的特征生成。
  • 模型采用端到端训练,基于预测特征的重建损失进行优化,掩码比率为60%以实现任务难度与信息保留之间的最佳平衡。
  • 应用旋转和均匀缩放的数据增强,同时谨慎处理以保持几何属性(如法向量和变化)的完整性。

实验结果

研究问题

  • RQ1在点云预训练中,重建点位置是否是最有效的3D掩码自编码掩蔽任务?
  • RQ2预测高阶几何特征(如表面法向量和表面变化)是否能带来优于位置重建的表征学习效果?
  • RQ3一种与编码器解耦的解码器架构是否能提升在不同3D主干网络上的泛化能力和性能?
  • RQ4不同内在特征组合(如法向量、变化、颜色)如何影响下游任务性能?
  • RQ5对于所提出的特征预测任务,最优超参数(如掩码比率和解码器深度)是什么?

主要发现

  • 同时重建表面法向量和表面变化可获得最佳性能,在ScanObjectNN分类任务上相比位置重建基线提升1.5%。
  • 4层解码器表现最佳,相比2层版本提升1.5%准确率,而更深网络则出现过拟合。
  • 60%的掩码比率达到最优性能,40%和90%的比率均导致次优学习,分别因任务过简或信息不足。
  • 从解码器中移除自注意力机制导致准确率下降2.0%,证明其在掩码点间特征传播中的关键作用。
  • 使用更多查询点(更高的查询/掩码比率)可提升性能,表明密集查询采样有助于增强特征恢复。
  • 在场景级数据(ScanNet)上,以表面变化和颜色作为预训练目标,可在S3DIS语义分割和检测任务中持续提升性能,表明该方法在大规模、噪声点云中具有良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。