Skip to main content
QUICK REVIEW

[논문 리뷰] Can We Solve 3D Vision Tasks Starting from A 2D Vision Transformer?

Yi Wang, Zhiwen Fan|arXiv (Cornell University)|2022. 09. 15.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 논문은 표준 2D ViT를 3D 시각 작업에 적응시키기 위해 패치 및 위치 임베딩을 팽창하고 헤드 레이어를 수정함으로써, 아키텍처 재설계 없이도 3D 분류, 세분화, 탐지 작업에서 뛰어난 성능을 달성하는 최소화된 3D 비전 트랜스포머인 Simple3D-Former을 제안한다. 사전 훈련된 2D ViT 가중치가 3D 일반화 능력을 크게 향상시키며, 특히 데이터가 적은 환경에서 두드러진다. 이는 강력하고 이식 가능한 기준 성능을 수립한다.

ABSTRACT

Vision Transformers (ViTs) have proven to be effective, in solving 2D image understanding tasks by training over large-scale image datasets; and meanwhile as a somehow separate track, in modeling the 3D visual world too such as voxels or point clouds. However, with the growing hope that transformers can become the "universal" modeling tool for heterogeneous data, ViTs for 2D and 3D tasks have so far adopted vastly different architecture designs that are hardly transferable. That invites an (over-)ambitious question: can we close the gap between the 2D and 3D ViT architectures? As a piloting study, this paper demonstrates the appealing promise to understand the 3D visual world, using a standard 2D ViT architecture, with only minimal customization at the input and output levels without redesigning the pipeline. To build a 3D ViT from its 2D sibling, we "inflate" the patch embedding and token sequence, accompanied with new positional encoding mechanisms designed to match the 3D data geometry. The resultant "minimalist" 3D ViT, named Simple3D-Former, performs surprisingly robustly on popular 3D tasks such as object classification, point cloud segmentation and indoor scene detection, compared to highly customized 3D-specific designs. It can hence act as a strong baseline for new 3D ViTs. Moreover, we note that pursing a unified 2D-3D ViT design has practical relevance besides just scientific curiosity. Specifically, we demonstrate that Simple3D-Former naturally enables to exploit the wealth of pre-trained weights from large-scale realistic 2D images (e.g., ImageNet), which can be plugged in to enhancing the 3D task performance "for free".

연구 동기 및 목표

  • 표준 2D 비전 트랜스포머가 최소한의 아키텍처 수정으로 3D 시각 작업에 효과적으로 적응될 수 있는지 조사하기 위해.
  • 사전 훈련된 2D ViT 가중치를 3D 작업으로 이식하여 일반화 능력을 향상시키는 효과를 평가하기 위해.
  • 2D와 3D 비전 트랜스포머 간 지식 이동을 가능하게 하는 통합된 2D-3D ViT 프레임워크를 구축하기 위해.
  • 단순한, 맞춤형으로 설계되지 않은 트랜스포머가 철저히 설계된 3D 전용 모델에 맞먹거나 이를 초월할 수 있는지 보여주기 위해.
  • 공동 사전 훈련을 통해 동일한 트랜스포머 백본이 2D 및 3D 시각 작업에 모두 적용 가능한지 가능성 탐색하기 위해.

제안 방법

  • 3D 볼륨 또는 포인트 클라우드 데이터를 처리하기 위해 2D 패치 임베딩 레이어를 팽창하여 3D 패치를 2D 유사 토큰으로 간주한다.
  • 3D 공간 차원 전반에 걸쳐 기하학적 구조를 유지하는 3D 인식 위치 인코딩을 설계한다.
  • 객체 분류, 세분화, 탐지와 같은 작업에 맞게 2D 분류 헤드를 3D 전용 헤드로 교체한다.
  • 사전 훈련된 2D ViT ImageNet 가중치를 초기화에 활용하여 3D 모델에 사전 지식을 통합한다.
  • 3D 데이터에서 미세 조정하는 동안 2D 일반화 능력을 유지하기 위해 교사 ViT에서 지식 정복을 적용한다.
  • 교차 엔트로피 손실과 정복 손실을 함께 사용하여 엔드 투 엔드로 모델을 훈련시켜, 데이터가 적은 조건에서도 성능을 유지한다.

실험 결과

연구 질문

  • RQ1표준 2D 비전 트랜스포머가 최소한의 아키텍처 변경으로 3D 시각 작업에 효과적으로 적응될 수 있는가?
  • RQ2대규모 2D 데이터(예: ImageNet)에서의 사전 훈련이 3D 시각 성능에 어느 정도 향상시키는가?
  • RQ32D 교사 ViT에서의 지식 정복이 3D 일반화 능력을 향상시키는가, 특히 데이터가 적은 환경에서 그렇다면?
  • RQ4통합된 트랜스포머 백본이 2D 및 3D 시각 작업에 공통으로 사용 가능하며, 공동 사전 훈련을 통해 기능할 수 있는가?
  • RQ5최소화된 3D ViT의 성능가 철저히 설계된 3D 전용 아키텍처와 비교해 볼 때 어떻게 되는가?

주요 결과

  • Simple3D-Former는 3D 객체 분류에서 경쟁적인 성능을 달성했으며, ModelNet40에서 84.5%의 정확도와 ShapeNet Part Segmentation에서 83.1%를 기록하여, 2D 사전 훈련이 없는 기준 모델보다 뛰어난 성능을 보였다.
  • SUN RGB-D 3D 탐지 벤치마크에서 Simple3D-Former는 mAP@25가 57.6%이고 mAP@50가 32.0%를 기록했으며, 아키텍처 변경이 최소화된 상태에서 3DETR 및 H3DNet과 유사한 성능을 보였다.
  • 2D 사전 훈련을 활용함으로써 ModelNet40에서 0.7% 향상되고, ShapeNet Part Segmentation에서는 1.5% 향상되어 2D 사전 지식의 가치를 입증했다.
  • 2D 교사 ViT에서의 지식 정복을 결합한 결과, ModelNet40에서 정확도가 88.0%로 상승하여, 기억 상실이 완화되고 일반화 능력이 향상됨을 보여주었다.
  • 저데이터 환경(학습 데이터의 25%)에서 2D 사전 훈련이 ShapeNet의 3D 파트 세분화 mIoU를 최대 1.6% 향상시켜, 뛀난 데이터 효율성을 보였다.
  • 제거 분석 결과, 사전 훈련과 정복 모두 최적의 성능을 내기 위해 필요하며, 둘 다 사용했을 때 ModelNet40에서 최고 성능(88.0%)을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.