Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Vision with Transformers: A Survey

Jean Lahoud, Jiale Cao|arXiv (Cornell University)|2022. 08. 08.
Advanced Neural Network Applications인용 수 9
한 줄 요약

이 종합 검토는 3D 시각 작업, 즉 분류, 세분화, 탐지, 복원 및 자세 추정에 대한 100여 개가 넘는 트랜스포머 기반 방법을 포괄적으로 검토한다. 점군, 복셀, RGB-D와 같은 다양한 3D 표현 방식에 맞춘 트랜스포머 아키텍처를 분석하여 장거리 종속성을 효과적으로 포착하고 12개의 벤치마크에서 최신 기술 수준 성능을 달성함을 보여주며, 설계, 샘플링, 위치 인코딩 및 사전 훈련 분야에서의 열린 과제를 밝혀낸다.

ABSTRACT

The success of the transformer architecture in natural language processing has recently triggered attention in the computer vision field. The transformer has been used as a replacement for the widely used convolution operators, due to its ability to learn long-range dependencies. This replacement was proven to be successful in numerous tasks, in which several state-of-the-art methods rely on transformers for better learning. In computer vision, the 3D field has also witnessed an increase in employing the transformer for 3D convolution neural networks and multi-layer perceptron networks. Although a number of surveys have focused on transformers in vision in general, 3D vision requires special attention due to the difference in data representation and processing when compared to 2D vision. In this work, we present a systematic and thorough review of more than 100 transformers methods for different 3D vision tasks, including classification, segmentation, detection, completion, pose estimation, and others. We discuss transformer design in 3D vision, which allows it to process data with various 3D representations. For each application, we highlight key properties and contributions of proposed transformer-based methods. To assess the competitiveness of these methods, we compare their performance to common non-transformer methods on 12 3D benchmarks. We conclude the survey by discussing different open directions and challenges for transformers in 3D vision. In addition to the presented papers, we aim to frequently update the latest relevant papers along with their corresponding implementations at: https://github.com/lahoud/3d-vision-transformers.

연구 동기 및 목표

  • 3D 시각 작업, 즉 분류, 세분화, 탐지, 복원 및 자세 추정에 대한 100여 개가 넘는 트랜스포머 기반 방법에 대한 체계적이고 철저한 검토를 제공하는 것.
  • 점군, 복셀, RGB-D 입력과 같은 다양한 3D 데이터 표현을 효과적으로 처리할 수 있도록 하는 트랜스포머 설계 선택 사항을 분석하는 것.
  • 12개의 널리 사용되는 3D 시각 벤치마크에서 트랜스포머 기반 방법과 비트랜스포머 기반 베이스라인 간의 성능를 비교하여 경쟁력을 평가하는 것.
  • 입력 샘플링 전략, 위치 인코딩, 데이터 증강, 사전 훈련과 같은 3D 시각 트랜스포머 분야의 주요 과제를 특정하고 논의하는 것.
  • https://github.com/lahoud/3d-vision-transformers에서 관련 논문과 구현을 동적으로 업데이트하는 레포지토리 유지

제안 방법

  • 점군, 복셀, RGB-D와 같은 3D 입력 표현 방식별로 분류된 100여 개 이상의 트랜스포머 기반 3D 시각 방법에 대한 체계적 문헌 검토를 수행한다.
  • 3D 데이터를 위한 트랜스포머 설계에서의 아키텍처 선택 사항을 분석하며, 3D 공간적 구조와 다양한 입력 크기에 적응한 자기주의 주의 메커니즘에 초점을 맞춘다.
  • MPJPE, PCK, AUC, mIoU 등의 지표를 사용하여 12개의 표준 3D 벤치마크에서 트랜스포머 기반 모델과 비트랜스포머 대비 모델 간의 성능를 평가한다.
  • 3D 공간에서의 위치 임bedding의 역할을 논의하며, 형태 이해와 3D 공간에서의 이동 불변성에 있어 그 중요성을 강조한다.
  • 데이터 샘플링 전략을 검토하며, 구조적 및 의미적 정보를 유지하기 위해 데이터 기반의 유연한 샘플링을 권장한다.
  • 3D 전용 데이터 증강 및 사전 훈련 기법의 사용을 평가하며, 현재 3D 트랜스포머 방법에서 이 기법들이 여전히 미흡하게 활용되고 있음을 부각한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처는 기존의 CNN 및 MLP에 비해 3D 시각 작업에서 성능을 어떻게 향상시키는가?
  • RQ2점군과 복셀과 같은 다양한 3D 데이터 표현을 효과적으로 처리할 수 있도록 하는 트랜스포머의 핵심 설계 원칙은 무엇인가?
  • RQ3위치 임베딩과 주의 메커니즘은 3D 공간에서의 학습에 어떻게 기여하며, 현재 접근 방식의 한계는 무엇인가?
  • RQ4트랜스포머를 위한 3D 입력 샘플링의 주요 과제는 무엇이며, 데이터 기반 전략은 특징 학습을 어떻게 향상시킬 수 있는가?
  • RQ5사전 훈련과 3D 전용 데이터 증강은 3D 시각 트랜스포머의 성능를 어느 정도 향상시킬 수 있는가?

주요 결과

  • 트랜스포머 기반 방법은 장거리 종속성 모델링이 필요한 작업에서 비트랜스포머 기반 베이스라인보다 일관되게 뛰어난 성능을 보였다.
  • MixSTE는 Human3.6M 데이터셋에서 프로토콜 1과 프로토콜 2에 각각 평균 MPJPE 42.4와 33.9를 기록하여 이중 시간적 및 공간적 트랜스포머 설계 덕분이었다.
  • P-STMO는 MPI-INF-3DHP 데이터셋에서 PCK(97.9)와 AUC(75.8)를 기록하여 자기지도 학습 기반 사전 훈련의 효과성을 입증했다.
  • 대부분의 트랜스포머 기반 3D 방법은 고정 크기의 입력 샘플링에 의존하여 세밀한 구조적 정보를 손실할 위험과 시나리오 크기에 의존하는 문제를 겪는다.
  • 2D 시각에서 ImageNet 기반 사전 훈련이 성능을 크게 향상시키는 것과 달리, 3D 시각 트랜스포머에서는 대규모 사전 훈련이 부족한 상황이다.
  • 이 조사에서는 국소적 세부 사항과 전역적 맥락 학습을 균형 있게 처리할 수 있는 일반적인 3D 트랜스포머 백본이 필요하며, 이는 데이터 기반의 샘플링과 강력한 위치 인코딩을 포함해야 한다고 규명했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.