Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Autoencoders in 3D Point Cloud Representation Learning

Jincen Jiang, Xuequan Lu|arXiv (Cornell University)|2022. 07. 04.
3D Shape Modeling and Analysis인용 수 4
한 줄 요약

이 논문은 불규칙한 3D 포인트 클라우드에 적합한 새로운 마스킹 오토인코더 프레임워크인 MAE3D를 제안한다. 포인트 클라우드는 패치로 분할되고, 일부 패치가 마스킹되며, 다중 작업 손실을 통해 패치 단위 트랜스포머를 사용해 손실된 부분을 재구성한다. 이는 단지 180만 개의 파rameter를 가진 경량 기반 모델을 사용하면서도 ModelNet40에서 93.4%의 정확도와 ScanObjectNN (PB_T50_RS)에서 86.2%의 정확도를 기록하여 최신 기술 수준을 초월한다.

ABSTRACT

Transformer-based Self-supervised Representation Learning methods learn generic features from unlabeled datasets for providing useful network initialization parameters for downstream tasks. Recently, self-supervised learning based upon masking local surface patches for 3D point cloud data has been under-explored. In this paper, we propose masked Autoencoders in 3D point cloud representation learning (abbreviated as MAE3D), a novel autoencoding paradigm for self-supervised learning. We first split the input point cloud into patches and mask a portion of them, then use our Patch Embedding Module to extract the features of unmasked patches. Secondly, we employ patch-wise MAE3D Transformers to learn both local features of point cloud patches and high-level contextual relationships between patches and complete the latent representations of masked patches. We use our Point Cloud Reconstruction Module with multi-task loss to complete the incomplete point cloud as a result. We conduct self-supervised pre-training on ShapeNet55 with the point cloud completion pre-text task and fine-tune the pre-trained model on ModelNet40 and ScanObjectNN (PB\_T50\_RS, the hardest variant). Comprehensive experiments demonstrate that the local features extracted by our MAE3D from point cloud patches are beneficial for downstream classification tasks, soundly outperforming state-of-the-art methods ($93.4\%$ and $86.2\%$ classification accuracy, respectively).

연구 동기 및 목표

  • 이미지나 텍스트와 같은 규칙적인 구조를 갖지 않는 비정규 3D 포인트 클라우드에 마스킹 오토인코더 사전 훈련을 적용하는 데 도전하는 것.
  • 복잡한 토크나이저나 무거운 인코더를 피하는 일반적이고 경량의 자기지도 학습 프레임워크를 개발하는 것.
  • 패치 단위 트랜스포머를 통해 국소 패치 특징과 전역적 맥락적 관계를 동시에 캡처하여 포인트 클라우드 표현 학습을 향상시키는 것.
  • 사전 훈련된 기반 모델만을 사용하여 별도의 큰 트랜스포머 인코더 없이도 강력한 최종 적용 성능을 달성하는 것.
  • 마스킹 재구성으로 사전 훈련을 수행할 경우 3D 분류 작업에서 특징의 분류 능력과 일반화 능력이 향상됨을 입증하는 것.

제안 방법

  • 입력 포인트 클라우드는 공간 패치로 나뉘며, 이 중 일부 패치가 랜덤으로 마스킹된다. 이는 BERT의 마스킹 언어 모델링과 유사하다.
  • 패치 임bed딩 모듈은 경량 기반 모델(예: PointNet 또는 DGCNN)을 사용해 마스킹되지 않은 패치의 특징을 추출한다.
  • 패치 단위 트랜스포머 인코더는 가시 패치를 처리하여 국소 기하학적 특징과 패치 간의 고차원 맥락적 관계를 학습한다.
  • 포인트 클라우드 재구성 모듈은 다중 작업 손실을 사용하여 은닉 표현에서 마스킹된 패치의 좌표를 예측하고 재구성한다.
  • 모델은 포인트 클라우드 완성 사전 과제를 통해 ShapeNet55에서 사전 훈련을 수행한 후, 최종 분류 벤치마크에서 미세조정을 수행한다.
  • 추론 시에는 오직 사전 훈련된 기반 모델만을 사용하여 특징 추출을 수행하며, 무거운 디코더나 보조 트랜스포머 인코더가 필요 없어진다.

실험 결과

연구 질문

  • RQ1규칙적인 격자 구조를 갖지 않는 비정규 3D 포인트 클라우드 데이터에 마스킹 오토인코더 프레임워크를 효과적으로 적용할 수 있는가?
  • RQ2마스킹된 포인트 클라우드 패치를 재구성하도록 학습하는 것이 최종 3D 분류 작업을 위한 학습된 표현의 품질을 향상시키는가?
  • RQ3매우 적은 파rameter(180만)를 가진 경량 기반 모델이 추가 트랜스포머 인코더에 의존하는 더 무거운 모델을 능가할 수 있는가?
  • RQ4미세조정 단계에서 복잡한 인코더가 없을 경우 더 강력하고 일반화 능력이 뛰어난 특징을 얻을 수 있는가?
  • RQ5은닉 표현 학습을 위한 전용 MAE3D 트랜스포머의 포함 여부가 최종 분류 정확도에 어떤 영향을 미치는가?

주요 결과

  • MAE3D는 ModelNet40에서 93.4%의 분류 정확도를 기록하여 최신 기술 수준을 초월한다.
  • 어려운 ScanObjectNN (PB_T50_RS) 벤치마크에서 MAE3D는 86.2%의 정확도를 달성하여 노이즈와 객체 변형에 대한 강력한 내성성을 보여준다.
  • 사전 훈련 단계에서 MAE3D 트랜스포머를 포함시킬 경우, 이를 포함하지 않은 버전 대비 정확도가 1% 향상되며, 이는 특징 학습에 기여함을 확인한다.
  • 단지 180만 개의 파rameter를 사용함에도 불구하고, MAE3D는 추가로 2200만 개의 파rameter를 가진 트랜스포머 인코더를 사용하는 Point-MAE보다도 성능이 뛰어나며, 인코더 없이 미세조정을 수행할 경우에도 동일한 조건에서 승리한다.
  • DGCNN을 기반 모델로 사용할 경우, MAE3D는 ModelNet40에서 93.4%의 정확도를 기록하며, 추가 트랜스포머 인코더를 사용하는 Point-MAE(93.1%)를 능가한다.
  • t-SNE 시각화 결과, MAE3D는 사전 훈련 단계에서조차도 초기 학습보다 더 분리 가능하고 분류 능력이 뛰어난 특징을 학습함을 확인했으며, 미세조정 이후 더욱 향상됨을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.