Skip to main content
QUICK REVIEW

[논문 리뷰] Vision Transformers in 2022: An Update on Tiny ImageNet

Ethan Huynh|arXiv (Cornell University)|2022. 05. 21.
Brain Tumor Detection and Classification인용 수 6
한 줄 요약

이 논문은 DeiT에 영감을 받은 표준화된 훈련 프로토콜을 사용하여 Tiny ImageNet에서 Vision Transformers(ViT, DeiT, CaiT, Swin)을 평가하며, Swin-L/4를 사용해 최신 기술 기준 정확도 91.35%를 달성하였다. 본 연구는 기존의 비전 트랜스포머 연구에서 간과되었음에도 불구하고 ImageNet-1k의 하위 집합으로서 관련성이 높은 Tiny ImageNet을 포함함으로써 전이 학습 벤치마크에서 중요한 격차를 메웠다.

ABSTRACT

The recent advances in image transformers have shown impressive results and have largely closed the gap between traditional CNN architectures. The standard procedure is to train on large datasets like ImageNet-21k and then finetune on ImageNet-1k. After finetuning, researches will often consider the transfer learning performance on smaller datasets such as CIFAR-10/100 but have left out Tiny ImageNet. This paper offers an update on vision transformers' performance on Tiny ImageNet. I include Vision Transformer (ViT) , Data Efficient Image Transformer (DeiT), Class Attention in Image Transformer (CaiT), and Swin Transformers. In addition, Swin Transformers beats the current state-of-the-art result with a validation accuracy of 91.35%. Code is available here: https://github.com/ehuynh1106/TinyImageNet-Transformers

연구 동기 및 목표

  • 전이 학습 연구에서 자주 생략되지만 관련성이 높은 Tiny ImageNet에서의 성능 평가를 통해 비전 트랜스포머 벤치마크의 격차를 메우기 위해.
  • DeiT의 훈련 방식과 유사한 일관된 훈련 체제를 사용하여 현대 비전 트랜스포머가 Tiny ImageNet으로 얼마나 잘 전이되는지 평가하기 위해.
  • Ablation 및 하이퍼파ram터 튜닝을 통해 Tiny ImageNet에서 비전 트랜스포머에 가장 효과적인 훈련 설정을 규명하기 위해.
  • 이 중간 규모의 데이터셋에서 ViT, DeiT, CaiT, Swin 아키텍처 간의 정확도, 효율성 및 훈련 속도를 비교하기 위해.

제안 방법

  • 384×384 입력 해상도와 128 배치 크기를 사용한 표준화된 훈련 프로토콜을 적용하여 ViT, DeiT, CaiT, Swin 트랜스포머를 Tiny ImageNet에서 미세조정함.
  • 일반화 성능 향상을 위해 Mixup, CutMix, Random Erasing 등의 데이터 증강 기법을 지정된 확률로 적용함.
  • 라벨 스무딩(ε=0.1), 스토하스틱 디pth(rate=0.1), AdamW 옵tim자와 코즈인 감쇠, 0.05의 가중치 감쇠를 사용함.
  • 모델 크기로 인한 배치 크기 제약을 감안해 RTX 3070(8GB VRAM)에서 기울기 누적 기법을 활용함.
  • 증강 및 정규화 기법을 제거하거나 교체하여 최적의 훈련 구성 요건을 규명하기 위해 Ablation 연구를 수행함.
  • SGD(Nesterov 모멘텀 포함)와 같은 대체 옵tim자르를 사용하여 AdamW와의 수렴성 및 정확도를 비교함.

실험 결과

연구 질문

  • RQ1DeiT에 영감을 받은 프로토콜로 훈련했을 때 비전 트랜스포머는 Tiny ImageNet에서 어떻게 성능을 내는가?
  • RQ2동일한 훈련 체제 하에서 어떤 비전 트랜스포머 아키텍처가 Tiny ImageNet에서 가장 높은 정확도를 달성하는가?
  • RQ3Tiny ImageNet에서 비전 트랜스포머를 훈련시키기 위한 최적의 데이터 증강 및 정규화 기법 조합은 무엇인가?
  • RQ4모델 파라미터 수, FLOPs, 레이어 수는 Tiny ImageNet에서 훈련 처리량과 성능에 어떻게 영향을 미치는가?
  • RQ5Model EMA 또는 AutoAugment는 RandAugment에 비해 Tiny ImageNet에서 성능 향상에 기여하는가?

주요 결과

  • Swin-L/4는 Tiny ImageNet에서 검증 정확도 91.35%를 기록하여 새로운 최신 기술 기준 성능을 달성함.
  • DeiT-B/16-D는 모든 모델 중에서 가장 빠른 훈련 속도를 기록했으며, 87.29%의 정확도를 달성하여 지식 정복 기법의 효과를 입증함.
  • RandAugment를 제거하면 테스트 정확도가 약간 향상됨(91.35% 대비 91.34%)하고 수렴이 더 안정적이므로, 이 설정에서는 여전히 불필요할 수 있음.
  • Model EMA는 정확도를 90.83%로 낮추었으며, 이는 이 데이터셋에선 성능 향상에 기여하지 않는다는 이전 연구 결과와 일치함.
  • AutoAugment와 두 가지 크롭 기법(RRC 및 SRC)은 성능 향상에 기여하지 않았으며, 더 단순한 증강 전략에 비해 열등함.
  • 파라미터 수와 FLOPs가 낮음에도 불구하고 CaiT-S/36는 가장 느린 훈련 속도를 보였으며, 이는 레이어 수가 모델 크기보다 훈련 처리량에 더 강력한 예측 변수임을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.