Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Point Cloud Reconstruction

Jaesung Choe, Byeongin Joung|arXiv (Cornell University)|2021. 11. 23.
3D Shape Modeling and Analysis참고 문헌 68인용 수 10
한 줄 요약

이 논문은 스캔에서의 흐려짐, 노이즈, 부족함을 동시에 해결하는 새로운 이중 단계 딥러닝 프레임워크를 제안한다. 첫 번째 단계에서는 희소 스택드아워글라스 네트워크를 사용해 복셀 기반의 밀도화와 노이즈 제거를 수행하고, 두 번째 단계에서는 확대된 위치 인코딩을 갖춘 트랜스포머 기반의 정밀화를 통해 복셀을 고품질의 3D 포인트로 다시 변환한다. 이로써 ScanNet, ICL-NUIM, ShapeNetPart 데이터셋에서 최신 기술 수준의 성능을 달성하며, 실제 환경의 장면으로의 일반화 능력도 뛰어나다.

ABSTRACT

Point cloud obtained from 3D scanning is often sparse, noisy, and irregular. To cope with these issues, recent studies have been separately conducted to densify, denoise, and complete inaccurate point cloud. In this paper, we advocate that jointly solving these tasks leads to significant improvement for point cloud reconstruction. To this end, we propose a deep point cloud reconstruction network consisting of two stages: 1) a 3D sparse stacked-hourglass network as for the initial densification and denoising, 2) a refinement via transformers converting the discrete voxels into 3D points. In particular, we further improve the performance of transformer by a newly proposed module called amplified positional encoding. This module has been designed to differently amplify the magnitude of positional encoding vectors based on the points' distances for adaptive refinements. Extensive experiments demonstrate that our network achieves state-of-the-art performance among the recent studies in the ScanNet, ICL-NUIM, and ShapeNetPart datasets. Moreover, we underline the ability of our network to generalize toward real-world and unmet scenes.

연구 동기 및 목표

  • 원시 3D 포인트 클라우드의 내재된 한계인 흐려짐, 노이즈, 비규칙성, 불완전성을 통합된 재구성 프레임워크를 통해 해결한다.
  • 이전 방법들이 밀도화, 노이즈 제거, 완성도를 별도의 작업으로 다루는 데서 비롯되는 한계를 극복하여 종종 최적의 결과를 내지 못하는 문제를 해결한다.
  • 새로운 장면과 실제 스캔 환경에서도 잘 작동하는 일반화 가능한, 객체에 관계없는 접근 방식을 개발한다.
  • 공간 주파수와 포인트 간격에 맞게 조정되는 새로운 위치 인코딩 전략을 도입하여 트랜스포머 기반의 포인트 정밀화 성능을 향상시킨다.

제안 방법

  • 이중 단계 아키텍처: 첫 번째로, 희소 컨볼루션을 사용해 3D 구조를 유지하면서 복셀 생성과 노이즈 제거를 수행하는 희소 스택드아워글라스 네트워크를 적용한다.
  • 두 번째로, 복셀을 고해상도 3D 포인트로 변환하기 위해 트랜스포머 기반의 복셀 재위치화 네트워크를 사용하여 세밀한 재구성 가능성을 확보한다.
  • 제안된 확대된 위치 인코딩은 포인트 간 거리에 따라 위치 임bedding의 크기를 조절하여 3D 공간 내 고주파 세부 정보 모델링을 향상시킨다.
  • 트랜스포머 내에서 자기주의 및 상호주의 메커니즘을 모두 활용하여 국소적 및 전역적 맥락을 효과적으로 포착한다.
  • 각 아워글라스 블록에서 복셀 정제 및 생성을 수행하여 구조적 일관성을 유지하고 희소 입력으로 인한 아티팩트를 방지한다.
  • 프레임워크는 엔드 투 엔드로 훈련되며, 표준 벤치마크에서 카프너 거리와 F-스코어를 사용해 평가된다.

실험 결과

연구 질문

  • RQ1밀도화, 노이즈 제거, 완성도를 하나의 프레임워크에서 동시에 해결할 경우, 별도의 작업으로 접근하는 것보다 더 나은 포인트 클라우드 재구성 성능를 달성할 수 있는가?
  • RQ2제안된 확대된 위치 인코딩은 표준 위치 인코딩과 비교해 트랜스포머 기반의 포인트 클라우드 정밀화에 어떤 영향을 미치는가?
  • RQ3제안된 방법이 실제 환경의, 예측하지 못한 3D 스캔 및 새로운 객체 카테고리로의 일반화 능력은 어느 정도인가?
  • RQ4트랜스포머 기반 정밀화 단계에서 자기주의 및 상호주의 모듈의 기여도는 어떠한가?

주요 결과

  • 제안된 방법은 ScanNet, ICL-NUIM, ShapeNetPart 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, $l_{\text{vox}} = 0.02$ 및 $\rho_{\text{in}} = 2048$ 조건에서 ShapeNet-Part에서 카프너 거리 1.195, F-스코어 55.488를 기록하였다.
  • 제거 분석 결과, 확대된 위치 인코딩이 표준 위치 인코딩($\text{gamma}_{\text{PE}}$)과 학습된 PE*보다 유의미하게 뛰어나며, 카프너 거리를 0.036 감소시킴을 확인하였다.
  • 자기주의 및 상호주의 레이어의 조합이 가장 높은 성능을 내며, 단일 주의 유형을 사용하는 모델보다 뛰어난 성능을 보였다.
  • 모델은 실제 스캔 환경으로의 일반화 능력이 뛰어나, 미세조정 없이도 새로운 장면과 예측하지 못한 객체 카테고리에서도 강건성을 유지하였다.
  • 복셀 생성 네트워크만으로도 카프너 거리 1.42를 달성했지만, 전체 이중 단계 시스템은 이를 1.195로 낮추어 정밀화 단계의 핵심적 역할을 입증하였다.
  • 희소하고 노이즈가 많은 입력을 효과적으로 처리하였으며, 첫 번째 단계에서 희소 스택드아워글라스 네트워크가 이상치를 효과적으로 제거하고 포인트 클라우드의 밀도를 높였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.