Skip to main content
QUICK REVIEW

[논문 리뷰] GeoMAE: Masked Geometric Target Prediction for Self-supervised Point Cloud Pre-Training

Xiao Yu Tian, Haoxi Ran|arXiv (Cornell University)|2023. 05. 15.
3D Surveying and Cultural HeritageEarth and Planetary Sciences인용 수 3
한 줄 요약

GeoMAE는 포인트 클라우드를 위한 자기지도 학습 사전 훈련 프레임워크를 제안하며, 중심점, 법선, 곡률 예측과 함께 점유도 예측을 활용하여 강력한 3D 표현을 학습한다. 이는 마스킹된 볼록화된 포인트 클라우드에 기반한 트랜스포머 기반 인코더-디코더를 훈련시켜 3D 검출, 세분화, 다중 객체 추적에서 최신 기술 수준의 성능을 달성한다. nuScenes에서 mAP 3.38, mIoU 2.1, AMOTA 1.7 향상률을 기록한다.

ABSTRACT

This paper tries to address a fundamental question in point cloud self-supervised learning: what is a good signal we should leverage to learn features from point clouds without annotations? To answer that, we introduce a point cloud representation learning framework, based on geometric feature reconstruction. In contrast to recent papers that directly adopt masked autoencoder (MAE) and only predict original coordinates or occupancy from masked point clouds, our method revisits differences between images and point clouds and identifies three self-supervised learning objectives peculiar to point clouds, namely centroid prediction, normal estimation, and curvature prediction. Combined with occupancy prediction, these four objectives yield an nontrivial self-supervised learning task and mutually facilitate models to better reason fine-grained geometry of point clouds. Our pipeline is conceptually simple and it consists of two major steps: first, it randomly masks out groups of points, followed by a Transformer-based point cloud encoder; second, a lightweight Transformer decoder predicts centroid, normal, and curvature for points in each voxel. We transfer the pre-trained Transformer encoder to a downstream peception model. On the nuScene Datset, our model achieves 3.38 mAP improvment for object detection, 2.1 mIoU gain for segmentation, and 1.7 AMOTA gain for multi-object tracking. We also conduct experiments on the Waymo Open Dataset and achieve significant performance improvements over baselines as well.

연구 동기 및 목표

  • 포인트 클라우드 표현 학습에서 내재된 기하적 특성을 활용하는 효과적인 자기지도 학습 목표의 부족을 해결하기 위해.
  • 포인트 클라우드에 고유하게 유용한 기하 특징—예를 들어 중심점, 법선, 곡률—을 식별하고 기존 방법에서 미처 활용되지 않은 바를 활용하기 위해.
  • 기하 특징에 기반한 사전 훈련을 통해 대규모 레이블이 없는 포인트 클라우드에서 사전 훈련을 수행함으로써 다운스트림 3D 인식 작업(검출, 세분화, 추적)의 성능을 향상시키기 위해.
  • 직접 좌표 또는 점유도 예측만으로는 기하 특징 재구성이 더 효과적인 자기지도 신호임을 입증하기 위해.
  • 포인트 클라우드 표현 학습을 위한 통합된 마스킹 오토인코딩 프레임워크 내에서 다중 기하 예측 헤드를 결합함으로써 효과를 검증하기 위해.

제안 방법

  • 입력 포인트 클라우드를 3D 격자로 볼록화하여 각 볼록을 학습 가능한 특징 토큰으로 변환한다.
  • 무작위 마스크를 적용하여 볼록 토큰의 그룹을 제거함으로써 이미지 MAE와 유사한 마스킹된 입력을 시뮬레이션하지만, 3D 기하에 적합하게 조정한다.
  • 남아 있는 포인트로부터 전역 기하적 맥락을 학습하기 위해 희소 트랜스포머 인코더가 가시 토큰을 인코딩한다.
  • 경량 트랜스포머 디코더가 병렬로 네 가지 기하 목표를 예측한다: 각 마스킹된 볼록에 대해 점유도, 중심점, 법선, 곡률.
  • 점유도, 중심점, 법선, 곡률 예측에 대한 L2 손실을 조합한 다중 작업 손실을 사용하여 모델을 사전 훈련한다.
  • 동일한 백본 아키텍처를 사용하여 추가 사전 훈련 데이터 없이 다운스트림 3D 인식 작업에 대해 사전 훈련된 인코더를 미세 조정한다.

실험 결과

연구 질문

  • RQ1중심점, 법선, 곡률과 같은 기하 특징이 포인트 클라우드 표현 학습을 위한 효과적인 자기지도 신호로 기능할 수 있는가?
  • RQ2점유도, 중심점, 법선, 곡률과 같은 다중 기하 예측 목표를 결합할 경우 단일 목표 마스킹 오토인코딩에 비해 특징 학습에 어떤 영향을 미치는가?
  • RQ3제안된 기하 특징에 기반한 사전 훈련 프레임워크가 다운스트림 3D 인식 작업에서 기존의 대조 학습 및 마스킹 모델링 베이스라인을 초월하는가?
  • RQ4기하 특징이 3D 검출, 세분화, 다중 객체 추적에서 더 나은 일반화 성능을 기여하는 정도는 어느 정도인가?
  • RQ5사전 훈련 데이터의 크기가 제안된 GeoMAE 프레임워크의 성능 향상에 어떤 영향을 미치는가?

주요 결과

  • nuScenes 데이터셋에서 GeoMAE는 기준 방법 대비 3D 객체 검출에서 mAP 3.38 향상, 3D 세분화에서 mIoU 2.1 향상하였다.
  • nuScenes에서 다중 객체 추적 성능이 AMOTA 1.7 향상되어 순차적 인식 작업으로의 강력한 일반화 능력을 입증하였다.
  • Waymo Open Dataset에서 GeoMAE는 기존 자기지도 학습 방법보다 뚜렷한 성능 향상을 기록하여 다양한 외부 포인트 클라우드 벤치마크에서의 일반화 능력을 확인하였다.
  • 제거 실험 결과 각 기하 예측 헤드가 전체 성능에 기여하며, 네 가지 목표의 조합이 가장 강력한 성능을 내는 것으로 나타났다.
  • GeoMAE의 성능은 더 큰 사전 훈련 데이터셋을 사용할수록 향상되어 제안된 기하 목표의 확장성과 강건성을 입증하였다.
  • 모든 평가된 다운스트림 작업에서 PointContrast, STRL, BYOL, SwAV와 같은 대조 학습 기반 베이스라인을 초월하여 자기지도 3D 포인트 클라우드 학습 분야에서 새로운 SOTA를 확립하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.