[논문 리뷰] ShapeFormer: Transformer-based Shape Completion via Sparse Representation
ShapeFormer는 불완전하거나 노이즈가 있는 포인트 클라우드에서 다양하고 고품질의 3D 색상 완성도를 생성하는 트랜스포머 기반의 생성 모델을 소개한다. 이는 3D 형태를 짧은 시퀀스로 압축하는 데 사용되는 새로운 희박한 이산 표현인 벡터 양자화 딥 임플리시트 함수(VQDIF)를 사용하여, 이전 방법보다 향상된 완성 품질과 다양성을 확보한 효율적인 순차적 생성을 가능하게 한다.
We present ShapeFormer, a transformer-based network that produces a distribution of object completions, conditioned on incomplete, and possibly noisy, point clouds. The resultant distribution can then be sampled to generate likely completions, each exhibiting plausible shape details while being faithful to the input. To facilitate the use of transformers for 3D, we introduce a compact 3D representation, vector quantized deep implicit function, that utilizes spatial sparsity to represent a close approximation of a 3D shape by a short sequence of discrete variables. Experiments demonstrate that ShapeFormer outperforms prior art for shape completion from ambiguous partial inputs in terms of both completion quality and diversity. We also show that our approach effectively handles a variety of shape types, incomplete patterns, and real-world scans.
연구 동기 및 목표
- 모호하거나 불완전하거나 노이즈가 있는 부분 포인트 클라우드에서 다수의 타당한 3D 형태 완성을 생성하는 문제를 해결하기 위해.
- 3D 형태 생성에 대해 트랜스포머를 효율적으로 사용할 수 있도록 하는 컴팩트하고 구조화된 3D 표현을 개발하기 위해.
- 단일 평균 형태로 회귀하는 것이 아니라 가능한 완성의 분포를 모델링하여 품질과 다양성 양면에서 향상시키기 위해.
- 희박한 이산 특징 시퀀스로부터 지오메트릭 정확도를 유지하면서도 충실하고 고해상도의 표면 재구성을 가능하게 하기 위해.
제안 방법
- 공간적 희박성과 벡터 양자화를 사용하여 2-튜플(위치 및 내용)의 짧은 시퀀스로 형태를 압축하는 희박하고 이산적인 3D 표현인 벡터 양자화 딥 임플리시트 함수(VQDIF)를 도입한다.
- 부분 입력 포인트 클라우드를 압축된 이산 토큰 시퀀스로 변환하는 VQDIF 인코더를 사용하여 해상도에 비례해 시퀀스 길이를 세제곱에서 제곱으로 감소시킨다.
- 부분 입력 시퀀스를 조건으로 삼아 다음 토큰을 예측하는 트랜스포머 기반 순차적 생성 모델을 사용하여 다양한 완성을 생성한다.
- 부분 입력 시퀀스를 전체 완성 시퀀스 앞에 붙여 조건부 생성을 가능하게 하기 위해 순차적 학습 목표를 수정한다.
- 생성된 이산 시퀀스를 다시 딥 임플리시트 함수로 디코딩하고, 마치징 컷스를 통해 고품질의 3D 표면을 추출한다.
- 미래 토큰을 예측하는 마스크된 언어 모델링 스타일의 목표를 사용해 모델을 엔드 투 엔드로 학습시켜 입력의 충실도를 유지하면서 타당한 완성을 생성한다.
실험 결과
연구 질문
- RQ1트랜스포머 기반 모델은 모호한 부분 입력에서 다양하고 고품질의 3D 형태 완성을 효과적으로 생성할 수 있는가?
- RQ23D 형태 표현을 어떻게 컴팩트하고 이산적으로 만들 수 있을까? 이는 트랜스포머를 사용한 효율적인 순차적 모델링을 가능하게 한다.
- RQ3제안된 VQDIF 표현은 표현 크기를 줄이면서도 기하학적 정확도를 어느 정도 유지하는가?
- RQ4다양한 형태 유형과 스캔 유형에서 기존 방법과 비교해 ShapeFormer는 완성 품질과 다양성 측면에서 어떤 성능을 보이는가?
주요 결과
- ShapeFormer는 PartNet에서 최신 기술 성능을 달성하여 기존의 다중 모달 방법인 cGAN 대비 FPD 점수를 최대 1.7점 향상시켰다.
- VQDIF 표현은 IF-Net과 ConvONet 수준의 재구성 정확도를 달성하면서도 훨씬 적은 바이트를 사용한다. 예를 들어 16³ 해상도에서 평균적으로 217개의 토큰만 사용한다.
- D-FAUST 데이터셋에서 ShapeFormer는 부분 입력이 주어진 인간 신체 스캔에 대해 다양한 포즈 일관성 있는 완성을 성공적으로 생성했으며, 훈련 데이터에 없던 신체 유형에도 잘 일반화되었다.
- 모델은 새로운 카테고리에 잘 일반화된다: 훈련 데이터에 포함되지 않은 컵과 티포트에 대해서도 타당한 완성을 생성한다.
- 시각적 비교를 통해 생성된 형태가 입력 포인트 클라우드와 밀도 있게 일치함을 확인했으며, 입력 스캔의 충실도를 유지함을 보였다.
- 추론 속도는 여전히 한계점으로, 평균적으로 한 형태당 약 20초가 소요되어 향후 작업에서 최적화가 필요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.