[논문 리뷰] Scaling Vision Transformers
이 논문은 500만에서 20억 파라미터의 모델을 100만에서 30억 장의 이미지 데이터셋에 대해 훈련시켜, 최대 1만 개의 TPUv3 코어-일을 사용하여 비전 트랜스포머(ViT)의 스케일링 법칙을 조사한다. 특히 최종 레이어에 강력한 L2 정규화를 적용한 아키텍처 및 훈련 개선 기법을 도입하여, 20억 파라미터 ViT가 ImageNet에서 90.45%의 top-1 정확도를 달성하고 새로운 최고 성능을 기록하였으며, 클래스당 10개의 예시만으로도 84.86%의 정확도를 달성하였다.
Attention-based neural networks such as the Vision Transformer (ViT) have recently attained state-of-the-art results on many computer vision benchmarks. Scale is a primary ingredient in attaining excellent results, therefore, understanding a model's scaling properties is a key to designing future generations effectively. While the laws for scaling Transformer language models have been studied, it is unknown how Vision Transformers scale. To address this, we scale ViT models and data, both up and down, and characterize the relationships between error rate, data, and compute. Along the way, we refine the architecture and training of ViT, reducing memory consumption and increasing accuracy of the resulting models. As a result, we successfully train a ViT model with two billion parameters, which attains a new state-of-the-art on ImageNet of 90.45% top-1 accuracy. The model also performs well for few-shot transfer, for example, reaching 84.86% top-1 accuracy on ImageNet with only 10 examples per class.
연구 동기 및 목표
- 비전 트랜스포머의 모델 크기, 데이터, 계산 자원에 따른 스케일링 특성을 이해하고, 특히 자연어 처리(NLP) 트랜스포머와의 비교를 포함한다.
- 표현 품질 향상과 소수의 예시로의 전이 성능 향상을 위해 아키텍처 및 훈련 레시피 개선 사항을 규명한다.
- 20억 파라미터의 대규모 ViT 모델을 훈련하고, ImageNet 및 소수의 예시 전이 벤치마크에서 성능을 평가한다.
- 성능-계산 자원의 경계를 특성화하고 스케일링 과정에서의 제약 요소(모델 크기, 데이터, 계산 자원)를 규명한다.
- 하드웨어 인식 설계 및 최적화기 선택을 통해 ViT의 메모리 소비를 줄이면서도 정확도를 유지하거나 향상시키는 방법을 탐색한다.
제안 방법
- TPUv3 하드웨어를 사용하여 ImageNet-21k 및 최대 30억 개의 약한 레이블이 부여된 이미지로 500만에서 20억 파라미터의 ViT 모델을 스케일링한다.
- ImageNet, CIFAR-100, Oxford IIIT Pets, Caltech-UCSD Birds에서 선형 10-shot 평가 및 전체 미세조정을 통해 표현 품질을 측정한다.
- 소수의 예시 전이 성능 향상을 위해 최종 선형 분류 레이어에만 강력한 L2 정규화를 적용한다.
- 수렴성과 일반화 성능 향상을 위해 학습률, 쿨다운 스텝 수, 가중치 감쇠 등의 훈련 초모델 하이퍼파라미터를 최적화한다.
- 하드웨어 특화 아키텍처 변경 및 수정된 최적화기를 통해 메모리 소비를 줄여 20억 파라미터 모델의 훈련을 가능하게 한다.
- 다양한 계산 자원, 모델 크기, 데이터 스케일에서 성능-계산 자원 경계를 근사하기 위해 포화 상태의 거듭제곱 법칙 모델을 사용한다.
실험 결과
연구 질문
- RQ1모델 크기, 훈련 데이터, 계산 예산을 증가시킬 때 ViT 모델의 정확도는 어떻게 변화하는가?
- RQ2다양한 구성에서 ViT 스케일링의 주요 제약 요소는 무엇인가? 모델 용량, 데이터셋 크기, 또는 계산 자원인가?
- RQ3최종 레이어에 강력한 L2 정규화를 적용할 경우 소수의 예시 전이 성능에 어떤 영향을 미치는가?
- RQ4아키텍처 및 훈련 레시피 개선 사항을 통해 메모리 소비를 줄일 수 있을까? 이는 더 큰 ViT 모델의 훈련 가능성을 높이는가?
- RQ5NLP 트랜스포머에서 관찰된 스케일링 법칙이 시각 영역으로 일반화되는 정도는 어느 정도인가?
주요 결과
- 20억 파라미터 비전 트랜스포머가 ImageNet에서 90.45%의 top-1 정확도를 달성하여 새로운 최고 성능을 기록하였다.
- 클래스당 10개의 예시만으로도 ViT-G 모델이 선형 10-shot 평가에서 ImageNet에서 84.86%의 top-1 정확도를 달성하였다.
- 클래스당 하나의 예시만으로도 69.52%의 정확도를 기록하여 강력한 소수의 예시 전이 능력을 입증하였다.
- 더 큰 모델은 10억 장 이상의 이미지 데이터를 포함해도 여전히 더 많은 데이터로부터 유의미한 이점을 얻는다; 3000만에서 3억 장의 이미지는 가장 큰 모델을 포화 상태로 만들기에 부족하다.
- 작은 모델은 너무 오래 훈련할 경우 성능-계산 자원 경계에서 벗어나며, 과적합 또는 계산 자원 비효율성의 징후를 보인다.
- 하드웨어 특화 아키텍처 변경 및 최적화기 수정을 통해 메모리 소비가 크게 감소하여, 20억 파라미터 ViT의 훈련이 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.