Skip to main content
QUICK REVIEW

[논문 리뷰] 3D-RETR: End-to-End Single and Multi-View 3D Reconstruction with Transformers

Zai Shi, Zhao Meng|arXiv (Cornell University)|2021. 10. 17.
3D Surveying and Cultural Heritage참고 문헌 50인용 수 9
한 줄 요약

3D-RETR는 사전학습된 비전 트랜스포머 인코더, 볼륨 특징 생성을 위한 트랜스포머 디코더, 최종 3D 출력을 위한 컨볼루션 네트워크 디코더를 활용하여 트랜스포머 기반의 엔드 투 엔드 단일 및 다중 뷰 3D 재구성 프레임워크를 제안한다. 이는 이전 모델들보다 훨씬 적은 파라미터로 최신 기술 수준의 성능을 달성한다.

ABSTRACT

3D reconstruction aims to reconstruct 3D objects from 2D views. Previous works for 3D reconstruction mainly focus on feature matching between views or using CNNs as backbones. Recently, Transformers have been shown effective in multiple applications of computer vision. However, whether or not Transformers can be used for 3D reconstruction is still unclear. In this paper, we fill this gap by proposing 3D-RETR, which is able to perform end-to-end 3D REconstruction with TRansformers. 3D-RETR first uses a pretrained Transformer to extract visual features from 2D input images. 3D-RETR then uses another Transformer Decoder to obtain the voxel features. A CNN Decoder then takes as input the voxel features to obtain the reconstructed objects. 3D-RETR is capable of 3D reconstruction from a single view or multiple views. Experimental results on two datasets show that 3DRETR reaches state-of-the-art performance on 3D reconstruction. Additional ablation study also demonstrates that 3D-DETR benefits from using Transformers.

연구 동기 및 목표

  • 단일 또는 다중 뷰 2D 이미지에서 트랜스포머를 사용한 엔드 투 엔드 3D 재구성에 대한 기존의 격차를 보완하기 위해.
  • 트랜스포머와 CNN을 효과적으로 통합하는 통합 아키텍처를 설계하기 위해.
  • 유사한 파라미터 예산 내에서 트랜스포머가 CNN 기반 백본보다 3D 재구성에서 더 우수한 성능을 낼 수 있음을 입증하기 위해.
  • 제안된 모델의 효율성과 효과성을 합성 및 실세계 데이터셋에서 검증하기 위해.

제안 방법

  • 사전학습된 비전 트랜스포머 인코더가 2D 입력 이미지에서 시각적 특징을 추출한다.
  • 별도의 트랜스포머 디코더가 이미지 특징에서 3D 볼륨 특징을 생성한다.
  • CNN 디코더가 볼륨 특징에서 최종 3D 객체를 재구성한다.
  • 볼륨 점유 예측을 최적화하기 위해 딱딱한 손실 함수를 사용하여 모델을 엔드 투 엔드로 훈련시킨다.
  • 디지털 토큰을 트랜스포머 디코더가 순차적으로 생성하는 VQ-VAE를 활용한 이중 단계 변형을 탐색한다.
  • 성분을 줄인 변형들(예: 최소한의 트랜스포머 디코더 또는 교체된 인코더 포함)을 비교하는 분석을 수행한다.

실험 결과

연구 질문

  • RQ1트랜스포머는 단일 또는 다중 뷰 2D 이미지에서 엔드 투 엔드 3D 재구성에 효과적으로 활용될 수 있는가?
  • RQ2성능 및 파라미터 효율성 측면에서 제안된 3D-RETR 아키텍처는 CNN 기반 기준 모델과 어떻게 비교되는가?
  • RQ3각 구성 요소인 트랜스포머 인코더, 트랜스포머 디코더, CNN 디코더가 최종 재구성 품질에 기여하는 정도는 어떠한가?
  • RQ4비전 트랜스포머 인코더를 사전학습하는 것이 성능 향상에 뚜렷한 기여를 하는가?
  • RQ53D 재구성에서 VQ-VAE를 활용한 이중 단계 접근 방식에 비해 단일 단계 훈련 설정이 더 우수한가?

주요 결과

  • 3D-RETR는 ShapeNet 데이터셋에서 평균 교차율(IoU) 0.680을 달성하여 이전 최신 기술 수준의 모델들을 능가한다.
  • 16300만 개의 파라미터만을 사용함에도 불구하고, 3D-RETR-B는 Pix2Vox++(9800만 파라미터) 및 Matryoshka(4600만 파라미터)와 같은 더 큰 모델들보다 뛰어난 성능을 보였다.
  • 분석 결과, 트랜스포머 디코더를 제거할 경우 IoU가 0.680에서 0.667로 감소하여 그 필수성을 입증했다.
  • 비전 트랜스포머 인코더를 ResNet-50으로 교체할 경우 성능은 0.680에서 0.670으로 떨어졌으며, 이는 자기주의 특징이 더 우수함을 시사한다.
  • 교차 엔트로피 손실을 딱딱한 손실 대신 사용할 경우 성능 저하가 발생하여, 딱딱한 손실이 3D 재구성에 최적임을 확인했다.
  • 이중 단계 VQ-VAE 변형은 단일 단계 3D-RETR보다 성능이 열 劣하여 엔드 투 엔드 훈련이 더 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.