Skip to main content
QUICK REVIEW

[논문 리뷰] Point Cloud Pre-training by Mixing and Disentangling

Chao Sun, Zhedong Zheng|arXiv (Cornell University)|2021. 09. 01.
3D Shape Modeling and Analysis참고 문헌 62인용 수 7
한 줄 요약

이 논문은 포인트 클라우드에 대한 자기지도 학습 사전 훈련 방법인 혼합 및 분리(Mixing and Disentangling, MD)를 제안한다. 이 방법은 혼합된 입력에서 원본 포인트 클라우드를 재구성하도록 모델을 훈련시킨다. 단순한 인코더-디코더 아키텍처에 인스턴스 적응형 디코딩을 활용함으로써 MD는 빠른 수렴과 분류 및 분할 작업에서 뛰어난 성능을 달성하며, 제한된 레이블 데이터가 있는 상황에서도 랜덤 초기화로 훈련하는 것보다 크게 슈퍼리어한 성능을 보인다.

ABSTRACT

The annotation for large-scale point clouds is still time-consuming and unavailable for many real-world tasks. Point cloud pre-training is one potential solution for obtaining a scalable model for fast adaptation. Therefore, in this paper, we investigate a new self-supervised learning approach, called Mixing and Disentangling (MD), for point cloud pre-training. As the name implies, we explore how to separate the original point cloud from the mixed point cloud, and leverage this challenging task as a pretext optimization objective for model training. Considering the limited training data in the original dataset, which is much less than prevailing ImageNet, the mixing process can efficiently generate more high-quality samples. We build one baseline network to verify our intuition, which simply contains two modules, encoder and decoder. Given a mixed point cloud, the encoder is first pre-trained to extract the semantic embedding. Then an instance-adaptive decoder is harnessed to disentangle the point clouds according to the embedding. Albeit simple, the encoder is inherently able to capture the point cloud keypoints after training and can be fast adapted to downstream tasks including classification and segmentation by the pre-training and fine-tuning paradigm. Extensive experiments on two datasets show that the encoder + ours (MD) significantly surpasses that of the encoder trained from scratch and converges quickly. In ablation studies, we further study the effect of each component and discuss the advantages of the proposed self-supervised learning strategy. We hope this self-supervised learning attempt on point clouds can pave the way for reducing the deeply-learned model dependence on large-scale labeled data and saving a lot of annotation costs in the future.

연구 동기 및 목표

  • 3D 딥러닝 분야에서 대규모 애너테이션된 포인트 클라우드 데이터셋의 부족 문제를 해결한다.
  • 자기지도 학습 사전 훈련 접근법을 개발하여 고비용 인간 애너테이션 데이터에 대한 의존도를 낮춘다.
  • 새로운 선구과업을 통해 모델의 일반화 능력과 후행 작업 성능(예: 분류, 분할)을 향상시킨다.
  • 포인트 클라우드 표현을 학습하기 위한 선구과업으로서 혼합 및 분리의 효과성을 탐색한다.
  • MD 사전 훈련을 통한 단순한 인코더-디코더 프레임워크가 빠른 피넷유징과 뛰어난 성능을 가능하게 함을 보여준다.

제안 방법

  • 두 포인트 클라우드를 혼합하여 복합 입력을 생성하는 자기지도 학습 선구과업을 제안한다.
  • 혼합된 포인트 클라우드에서 의미적 임베딩을 추출하기 위해 인코더를 훈련한다.
  • 인코딩된 임베딩을 사용하여 디코더가 혼합 입력에서 원래의 포인트 클라우드를 분리해내도록 인스턴스 적응형 디코더를 사용한다.
  • 분리된 출력의 재구성 손실을 사용하여 인코더와 디코더를 엔드 투 엔드로 훈련한다.
  • 특히 대규모 포인트 클라우드 애너테이션의 부족함을 감안할 때, 혼합 과정을 통해 훈련 데이터를 효율적으로 증강한다.
  • 소량의 레이블 데이터만을 사용하여 후행 작업에 대해 사전 훈련된 인코더를 피넷유징 적용한다.

실험 결과

연구 질문

  • RQ1포인트 클라우드의 혼합 및 분리는 자기지도 사전 훈련을 위한 효과적인 선구과업이 될 수 있는가?
  • RQ2MD 방법은 후행 작업에서 수렴 속도와 성능 측면에서 랜덤 초기화 훈련과 비교해 어떻게 성능을 냈는가?
  • RQ3제안된 방법이 관건 포인트와 같은 의미 있는 포인트 클라우드 특징을 어느 정도 잘 포착하는가?
  • RQ4MD 프레임워크의 개별 구성 요소(예: 혼합 전략, 인스턴스 적응형 디코딩)가 성능에 어떤 기여를 하는가?
  • RQ5소량의 피넷유징만으로도 다양한 3D 작업(예: 분류, 분할)에 대해 사전 훈련된 모델이 잘 일반화되는가?

주요 결과

  • MD 사전 훈련 방법은 분류 및 분할 작업 모두에서 랜덤 초기화 훈련보다 뚜렷이 뛰어난 성능을 보였다.
  • 사전 훈련된 인코더는 후행 작업에서 랜덤 초기화보다 빠른 수렴과 더 높은 정확도를 달성했다.
  • 모델은 포인트 클라우드의 관건 구조를 잘 포착하는 것으로 나타나, 효과적인 특징 학습이 이루어졌음을 시사한다.
  • 제거 실험을 통해 혼합 전략과 인스턴스 적응형 디코딩이 성능 향상에 필수적임을 확인했다.
  • 혼합을 통한 고품질 증강 샘플 생성을 통해 데이터 부족 문제를 효과적으로 완화했다.
  • 사전 훈련된 인코더는 후행 작업에 대해 빠르게 피넷유징 가능하며, 강력한 전이 가능성과 확장성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.