Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Surfel Prediction for Self-Supervised Point Cloud Learning

Yabin Zhang, Jiehong Lin|arXiv (Cornell University)|2022. 07. 07.
3D Shape Modeling and Analysis인용 수 9
한 줄 요약

이 논문은 변형기 기반 인코더-디코더 네트워크를 사용하여 마스킹된 설면 요소(스르엘)의 위치와 법선을 동시에 예측하는 새로운 비지도 학습 방법인 마스킹드 설면 예측(MaskSurf)을 제안한다. 설면 예측을 통해 국소 기하학적 구조를 통합함으로써 카프너 거리와 새로운 위치 인덱스 기반 법선 거리(Position-Indexed Normal Distance, PIND)로 감독받는 바, MaskSurf는 스캔오브젝트엔(ScanObjectNN)의 OBJ-BG 설정에서 Point-MAE보다 1.2% 높은 성능을 기록하며, 모든 미세조정 프로토콜에서 최신 기술 수준을 달성한다.

ABSTRACT

Masked auto-encoding is a popular and effective self-supervised learning approach to point cloud learning. However, most of the existing methods reconstruct only the masked points and overlook the local geometry information, which is also important to understand the point cloud data. In this work, we make the first attempt, to the best of our knowledge, to consider the local geometry information explicitly into the masked auto-encoding, and propose a novel Masked Surfel Prediction (MaskSurf) method. Specifically, given the input point cloud masked at a high ratio, we learn a transformer-based encoder-decoder network to estimate the underlying masked surfels by simultaneously predicting the surfel positions (i.e., points) and per-surfel orientations (i.e., normals). The predictions of points and normals are supervised by the Chamfer Distance and a newly introduced Position-Indexed Normal Distance in a set-to-set manner. Our MaskSurf is validated on six downstream tasks under three fine-tuning strategies. In particular, MaskSurf outperforms its closest competitor, Point-MAE, by 1.2\% on the real-world dataset of ScanObjectNN under the OBJ-BG setting, justifying the advantages of masked surfel prediction over masked point cloud reconstruction. Codes will be available at https://github.com/YBZh/MaskSurf.

연구 동기 및 목표

  • 기존의 마스킹된 오토인코딩 방법이 마스킹된 점들을 재구성하는 것에만 집중하고 국소 기하학적 구조를 간과한다는 한계를 해결하기 위해.
  • 위치와 법선을 갖는 표면 요소인 설면을 통해 국소 기하학을 명시적으로 모델링하면 비지도 표현 학습에 기여할 수 있는지 탐색하기 위해.
  • 마스킹된 포인트 클라우드에서 설면 위치와 법선을 동시에 예측하는 새로운 사전 과제를 개발하여 기하학적 세부 정보를 더 잘 포착하기 위해.
  • 다양한 최종 응용 작업과 미세조정 전략에서 설면 기반 재구성 방식이 점만 기반 재구성보다 우월함을 입증하기 위해.

제안 방법

  • 지역 패치에 고비율 마스킹을 적용하기 위해 군집 전략을 사용하여 포인트 클라우드를 마스킹된 입력으로 표현하기.
  • 마스킹된 포인트 패치로부터 잠재적 설면 클라우드를 예측하기 위해 변형기 기반 인코더-디코더 네트워크 설계하기.
  • 집합에서 집합으로의 방식으로 설면 위치(점들)와 각 설면의 방향(법선)을 동시에 예측하기.
  • 예측된 설면 위치와 진짜 설면 위치 사이의 카프너 거리(Chamfer Distance, CD)를 사용해 점 예측을 감독하기.
  • 공간적 대응 기반으로 예측된 법선을 진짜 법선과 정렬함으로써 법선 예측을 감독하기 위해 새로운 위치 인덱스 기반 법선 거리(Position-Indexed Normal Distance, PIND) 도입하기.
  • 마스킹된 설면 예측을 사전 과제로 사용하여 끝내기까지의 학습을 수행함으로써 인간의 레이블 없이 기하학적 인식 특징을 학습하기.

실험 결과

연구 질문

  • RQ1표면 요소(설면)를 통해 국소 기하학적 구조를 명시적으로 모델링하면 기존의 마스킹된 점 재구성 방식보다 비지도 포인트 클라우드 표현 학습에 기여할 수 있는가?
  • RQ2설면 위치와 법선을 동시에 예측하는 것이 오직 점들만 예측하는 것보다 더 나은 특징 학습을 이끌어낼 수 있는가?
  • RQ3MaskSurf는 분류, 세분화, 소수 학습, 도메인 일반화를 포함한 다양한 최종 응용 작업에서 어떻게 성능을 발휘하는가?
  • RQ4배경 혼잡도 및 경계 상자 변형과 같은 도전적인 설정에서 설면 기반 기하학적 모델링이 모델의 일반화력과 강건성에 기여하는 정도는 어떠한가?

주요 결과

  • 실제 환경의 ScanObjectNN 데이터셋에서 OBJ-BG 설정에서 MaskSurf는 91.22%의 정확도를 기록하여 Point-MAE보다 1.2% 높은 성능을 보였다.
  • ModelNet40 소수 학습 분류 벤치마크에서 MaskSurf는 10-샷, 5웨이 조건에서 96.5%의 정확도를 기록하여 Point-MAE의 96.3%를 초월했다.
  • ShapeNetPart에서의 파트 세분화 작업에서 MaskSurf는 전이 특징 프로토콜 하에서 평균 IoU(mIoUc) 84.36%를 기록하여 Point-MAE의 84.19%를 넘어서는 성과를 보였다.
  • S3DIS Area5에서의 의미 세분화 작업에서 MaskSurf는 시각적 비교 결과 Point-MAE보다 뛰어난 결과를 보였다.
  • 제안된 위치 인덱스 기반 법선 거리(Position-Indexed Normal Distance, PIND)는 법선 예측 정확도를 효과적으로 향상시켜 더 나은 기하학적 특징 학습에 기여하였다.
  • MaskSurf는 모든 6개의 최종 응용 작업과 세 가지의 미세조정 전략(특징 전이, 선형, 비선형 분류)에서 Point-MAE를 일관되게 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.