Skip to main content
QUICK REVIEW

[논문 리뷰] How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers

Andreas Steiner, А. И. Колесников|arXiv (Cornell University)|2021. 06. 18.
Advanced Neural Network Applications인용 수 228
한 줄 요약

논문은 데이터 크기, 증가(Augmentation), 정규화, 모델 크기, 컴퓨트 예 budget가 비전 트랜스포머에 어떻게 상호 작용하는지 체계적으로 연구하여 AugReg가 대형 데이터의 대체가 될 수 있음을 보여주고, 더 큰 상위 데이터셋으로의 전이 학습이 종종 더 비용 효과적임을 보여준다.

ABSTRACT

Vision Transformers (ViT) have been shown to attain highly competitive performance for a wide range of vision applications, such as image classification, object detection and semantic image segmentation. In comparison to convolutional neural networks, the Vision Transformer's weaker inductive bias is generally found to cause an increased reliance on model regularization or data augmentation ("AugReg" for short) when training on smaller training datasets. We conduct a systematic empirical study in order to better understand the interplay between the amount of training data, AugReg, model size and compute budget. As one result of this study we find that the combination of increased compute and AugReg can yield models with the same performance as models trained on an order of magnitude more training data: we train ViT models of various sizes on the public ImageNet-21k dataset which either match or outperform their counterparts trained on the larger, but not publicly available JFT-300M dataset.

연구 동기 및 목표

  • ViTs에서 모델 크기별로 학습 데이터 크기, 증가 및 정규화가 어떻게 상호 작용하는지 이해한다.
  • 사전 학습 ViTs를 다운스트림 작업으로 전이하는 데 필요한 컴퓨트 및 데이터 트레이드오프를 정량화한다.
  • AugReg로 다이나믹하게 트레이닝하는 것과 함께 데이터셋 다양성에 대해 전이 학습과 무에서의 학습 비교를 평가한다.
  • 다양한 데이터 세트에서 AugReg를 활용한 전이 학습과 무에서의 학습을 비교 평가한다.
  • 사전 학습 체크포인트와 학습 전략을 컴퓨트 제약 하에서 선택하기 위한 실용적인 권고를 식별한다.

제안 방법

  • ImageNet-1k 및 ImageNet-21k에서 TPU/JAX/Flax의 일관된 구성으로 여러 크기(Ti, S, B, L)의 ViT 모델과 ResNet+ViT 하이브리드를 사전 학습한다.
  • 정규화(Dropout, stochastic depth) 및 증강(Mixup, RandAugment)을 28-구성 하이퍼파라미터 스윕으로 적용한다.
  • 다운스트림 데이터셋에서 SGD와 코사인 스케줄로 미세 조정하고 from-scratch와 업스트림 모델에서의 전이를 비교한다.
  • 데이터 규모, 컴퓨트 예산 및 증강 강도를 체계적으로 변화시켜 성능 풍경을 매핑한다.

실험 결과

연구 질문

  • RQ1데이터 크기, 증강 및 정규화가 모델 크기에 따라 ViT 성능에 어떻게 영향을 주는가?
  • RQ2더 큰 상류 데이터셋에서의 전이 학습이 AugReg를 사용한 무에서의 학습보다 일반적으로 비용 효율적인가?
  • RQ3VTAB 작업 전반에서 증가하는 사전 학습 데이터가 전이 성능에 어떻게 영향을 미치는가?
  • RQ4컴퓨트 제약 하에서 사전 학습 체크포인트 및 학습 전략 선택에 대한 실용적인 지침은 무엇인가?

주요 결과

  • AugReg는 ViTs의 비교 가능한 작업에서 학습 데이터 10배 증가의 이득과 대등하게 작용할 수 있다.
  • 사전 학습된 모델에서의 전이 학습은 일반적으로 비용 효율적이고 실용적인 데이터세트에서 from-scratch 학습보다 더 나은 결과를 제공한다.
  • 더 많은 사전 학습 데이터는 더 일반적인 모델을 만들어 다양한 VTAB 작업에서 더 잘 전이된다.
  • 증강은 중간 크기의 데이터세트에서 더 도움이 되나, 매우 큰 상류 데이터(ImageNet-21k, 고정된 컴퓨트)에서는 컴퓨트를 증가시키지 않으면 AugReg가 종종 해를 끼친다.
  • 상류 검증 정확도로 상류 모델을 선택하는 것이 전이에는 보통 효과적이다; ImageNet-21k 체크포인트를 사용하는 것이 권장된다.
  • 패치 크기를 32로 늘리면 비슷한 속도의 더 얇은 모델보다 우수할 수 있어 패치 크기가 매개변수 수 외의 핵심 용량 요인임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.