Skip to main content
QUICK REVIEW

[논문 리뷰] Vision Xformers: Efficient Attention for Image Classification

Pranav Jeevan, Amit Sethi|arXiv (Cornell University)|2021. 07. 05.
Advanced Neural Network Applications참고 문헌 18인용 수 12
한 줄 요약

이 논문은 시각적 트랜스포머(ViT) 아키텍처를 수정한 비전 X-포머(ViX)를 제안한다. 이는 제곱형 자기주의(self-attention)를 선형주의 메커니즘(예: Performer, Linformer, Nyströmformer)으로 대체하고, 인덕티브 바이어스를 제공하기 위해 컨볼루션 임베딩 레이어를 통합하며, 로테이션 위치 임베딩(RoPE)을 채택한다. 이러한 변경으로 인해 GPU 메모리 사용량이 최대 7배까지 감소하면서도 이미지 분류 정확도는 유지 또는 향상되며, 특히 소규모 데이터셋에서 뛰어난 성능을 보여, 자원이 제한된 환경에서도 트랜스포머를 보다 쉽게 활용할 수 있게 한다.

ABSTRACT

Although transformers have become the neural architectures of choice for natural language processing, they require orders of magnitude more training data, GPU memory, and computations in order to compete with convolutional neural networks for computer vision. The attention mechanism of transformers scales quadratically with the length of the input sequence, and unrolled images have long sequence lengths. Plus, transformers lack an inductive bias that is appropriate for images. We tested three modifications to vision transformer (ViT) architectures that address these shortcomings. Firstly, we alleviate the quadratic bottleneck by using linear attention mechanisms, called X-formers (such that, X in {Performer, Linformer, Nyströmformer}), thereby creating Vision X-formers (ViXs). This resulted in up to a seven times reduction in the GPU memory requirement. We also compared their performance with FNet and multi-layer perceptron mixers, which further reduced the GPU memory requirement. Secondly, we introduced an inductive bias for images by replacing the initial linear embedding layer by convolutional layers in ViX, which significantly increased classification accuracy without increasing the model size. Thirdly, we replaced the learnable 1D position embeddings in ViT with Rotary Position Embedding (RoPE), which increases the classification accuracy for the same model size. We believe that incorporating such changes can democratize transformers by making them accessible to those with limited data and computing resources.

연구 동기 및 목표

  • 비전 트랜스포머(ViT)의 이차형 주의 복잡도로 인한 높은 계산 및 메모리 비용을 해결하기 위해.
  • 컨볼루션 임베딩 레이어를 통해 인덕티브 바이어스를 도입하여 제한된 데이터로도 ViT의 이미지 분류 정확도를 향상시키기 위해.
  • 학습 가능한 1차원 위치 임베딩을 로테이션 위치 임베딩(RoPE)으로 대체하여 모델의 일반화 능력과 성능을 향상시키기 위해.
  • 이러한 아키텍처 수정 사항이 LeViT, CCT, CvT, PiT, FNet, MLP 믹서 등 다양한 트랜스포머 기반 시각 모델에 일반적으로 적용될 수 있음을 보여주기 위해.
  • 데이터와 계산 자원 요구량을 줄여 시각 트랜스포머의 접근성을 높이기 위해.

제안 방법

  • ViT의 표준 자기주의 메커니즘을 Performer, Linformer, Nyströmformer 등의 선형주의 메커니즘으로 대체하여 계산 복잡도를 O(n²)에서 O(n)으로 감소시키기 위해.
  • 초기 선형 패치 임베딩 레이어를 컨볼루션 레이어 스택으로 대체하여 2차원 이미지 구조에 대한 인덕티브 바이어스를 제공하기 위해.
  • 학습 가능한 1차원 위치 임베딩을 로테이션 위치 임베딩(RoPE)으로 대체하여 상대적 위치 정보를 더 효과적으로 인코딩하고 다양한 시퀀스 길이에 더 잘 일반화되도록 하기 위해.
  • 저자원 및 저GPU 메모리 환경에서 표준 이미지 분류 벤치마크(예: ImageNet)에서 수정된 ViX 모델을 훈련하고 평가하기 위해.
  • 제안된 수정 사항을 LeViT, CCT, CvT, PiT 등의 다른 비전 트랜스포머 아키텍처와 FNet, MLP 믹서 등의 효율적 모델에 적용하여 일반화 능력을 평가하기 위해.
  • 모든 변종 간 성능 및 자원 사용량(GPU 메모리, FLOPs, 추론 시간)을 비교하여 효율성 향상을 정량화하기 위해.

실험 결과

연구 질문

  • RQ1이차형 자기주의를 선형주의 메커니즘으로 대체함으로써 비전 트랜스포머에서 GPU 메모리와 계산 비용을 크게 줄일 수 있을까? 정확도 손실 없이 가능할까?
  • RQ2선형 임베딩 레이어를 컨볼루션 레이어로 대체함으로써 2차원 인덕티브 바이어스를 도입함으로써 이미지 분류 정확도가 향상될 수 있을까?
  • RQ3로테이션 위치 임베딩(RoPE)이 학습 가능한 1차원 위치 임베딩을 초월하여 비전 트랜스포머에서 성능을 뛰어올릴 수 있을까? 특히 저자원 데이터 환경에서?
  • RQ4이러한 아키텍처 수정 사항이 LeViT, CCT, CvT, PiT 등의 다양한 비전 트랜스포머 아키텍처와 FNet, MLP 믹서와 같은 효율적 모델에 얼마나 일반화될 수 있을까?
  • RQ5이러한 변경 사항을 통해 데이터와 하드웨어 요구량을 크게 줄이고도 최신 기술 수준의 이미지 분류 성능을 달성할 수 있을까?

주요 결과

  • ViX에 선형주의 메커니즘(예: Performer, Nyströmformer)을 적용함으로써 표준 ViT 대비 GPU 메모리 사용량을 최대 7배까지 감소시켰고, 정확도는 유사하거나 향상된 결과를 보였다.
  • 선형 임베딩 레이어를 컨볼루션 레이어로 대체함으로써 더 작은 모델 크기와 더 적은 훈련 데이터로도 이미지 분류 정확도가 뚜렷이 향상되었으며, 2차원 인덕티브 바이어스의 유용성을 입증했다.
  • 로테이션 위치 임베딩(RoPE)을 도입함으로써 학습 가능한 1차원 위치 임베딩보다 정확도가 더 향상되었고, 모델 파라미터 수나 메모리 사용량이 크게 증가하지 않았다.
  • 제안된 수정 사항은 LeViT, CCT, CvT, PiT 등 여러 비전 트랜스포머 아키텍처에 효과적으로 적용되었으며, 광범위한 적용 가능성과 일관된 성능 향상을 보였다.
  • FNet 및 MLP 믹서 모델 또한 이 수정 사항으로부터 유의미한 이점을 얻었으며, FNet은 컨볼루션 임베딩과 조합했을 때 뚜렷한 정확도 향상을 보였지만, MLP 믹서는 이러한 하이브리드 설계에서 유의미한 성능 향상을 얻지 못했다.
  • 선형주의, 컨볼루션 임베딩, RoPE의 조합은 데이터 및 계산 요구량을 줄이며 높은 성능의 이미지 분류를 가능하게 하여, 자원이 제한된 환경에서 트랜스포머의 접근성을 더욱 높였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.