Skip to main content
QUICK REVIEW

[논문 리뷰] Auto-scaling Vision Transformers without Training

Wuyang Chen, Wei Huang|arXiv (Cornell University)|2022. 02. 24.
Advanced Neural Network Applications인용 수 7
한 줄 요약

As-ViT는 복잡도 기반 검색를 통해 최적의 '시드' 아키텍처를 먼저 발견한 후, 균형 잡힌 깊이와 너비를 유지하면서 이를 체계적으로 확장하는 훈련이 없는 자동화된 프레임워크를 제안한다. 이 방법은 단 12시간의 V100 GPU 시간으로 ImageNet-1k에서 83.5%의 top-1 정확도와 COCO 검출에서 52.7%의 mAP를 달성하며 최신 기술 수준을 확보하였으며, 새로운 점진적 재토크나이제이션 전략을 통해 훈련 FLOPs를 최대 56.2% 감소시켰다.

ABSTRACT

This work targets automated designing and scaling of Vision Transformers (ViTs). The motivation comes from two pain spots: 1) the lack of efficient and principled methods for designing and scaling ViTs; 2) the tremendous computational cost of training ViT that is much heavier than its convolution counterpart. To tackle these issues, we propose As-ViT, an auto-scaling framework for ViTs without training, which automatically discovers and scales up ViTs in an efficient and principled manner. Specifically, we first design a "seed" ViT topology by leveraging a training-free search process. This extremely fast search is fulfilled by a comprehensive study of ViT's network complexity, yielding a strong Kendall-tau correlation with ground-truth accuracies. Second, starting from the "seed" topology, we automate the scaling rule for ViTs by growing widths/depths to different ViT layers. This results in a series of architectures with different numbers of parameters in a single run. Finally, based on the observation that ViTs can tolerate coarse tokenization in early training stages, we propose a progressive tokenization strategy to train ViTs faster and cheaper. As a unified framework, As-ViT achieves strong performance on classification (83.5% top1 on ImageNet-1k) and detection (52.7% mAP on COCO) without any manual crafting nor scaling of ViT architectures: the end-to-end model design and scaling process cost only 12 hours on one V100 GPU. Our code is available at https://github.com/VITA-Group/AsViT.

연구 동기 및 목표

  • 비용이 많이 드는 훈련 없이도 원칙적이고 효율적인 Vision Transformer(ViTs) 설계 및 스케일링 방법의 부족을 해결하기 위해.
  • CNN보다 훨씬 더 무거운 ViT 훈련의 높은 계산 비용을 줄이기 위해.
  • 통합된 종단 간 프레임워크에서 아키텍처 탐색과 스케일링을 자동화하기 위해.
  • 수동 하이퍼파라미터 튜닝이나 광범위한 하이퍼파라미터 탐색 없이도 고성능 ViT를 가능하게 하기 위해.
  • 실제 모델 정확도와 강하게 상관관계를 가지는 확장 가능한 훈련 없는 검색 방법을 개발하기 위해.

제안 방법

  • 네트워크 복잡도 지표—특히 기대 길이 왜곡—를 정확도의 대체 지표로 사용하는 훈련 없는 아키텍처 검색을 통해 ViT 아키텍처의 빠른 평가가 가능하다.
  • 기존 수동 ViT 설계를 바탕으로 한 느슨한 검색 공간에서 복잡도 기반 순위 매기기로 비용이 많이 드는 훈련 없이 '시드' ViT 아키텍처를 발견한다.
  • 원칙적인 스케일링 규칙을 통해 레이어별로 깊이와 너비를 단계적으로 증가시켜, 각 단계에서 균형 잡힌 네트워크 복잡도를 유지한다.
  • 점진적 재토크나이제이션은 훈련 중에 도약과 스트라이드를 통해 토큰화를 동적으로 조정하여 토큰 수를 줄이고 훈련 속도를 높인다.
  • 단일 시드 아키텍처에서 시작하여 한 번의 실행으로 다양한 파rameter 수를 가진 ViT 변종의 시리즈를 생성한다.
  • ViT가 훈련 초반에 굵은 토크나이제이션을 잘 견딜 수 있다는 관찰을 기반으로 효율적인 점진적 정밀화가 가능하다.

실험 결과

연구 질문

  • RQ1네트워크 복잡도 지표 기반의 훈련 없는 검색이 실제 훈련 없이도 ViT 성능을 신뢰성 있게 예측할 수 있는가?
  • RQ2깊이와 너비를 균형 있게 유지하면서 성능을 유지하는 최적의 ViT 스케일링 전략은 무엇인가?
  • RQ3특히 대규모 모델에 대해 정확도를 희생시키지 않고 ViT 훈련을 어떻게 가속화할 수 있는가?
  • RQ4단일 시드 아키텍처를 추가 비용을 최소한으로 하여 다수의 변종으로 체계적으로 확장할 수 있는가?
  • RQ5점진적 재토크나이제이션 전략은 정확도를 유지하면서 훈련 효율성을 향상시키는가?

주요 결과

  • 기대 길이 왜곡 지표는 계산 비용과 실제 ViT 정확도와의 Kendall-tau 상관관계 사이에서 최적의 균형을 이룹니다. 따라서 훈련 없는 검색에 이상적입니다.
  • As-ViT 프레임워크는 단 7시간의 V100 GPU 시간으로 '시드' ViT 아키텍처를 발견하고, 추가로 5시간의 GPU 시간으로 스케일링을 수행하여 총 12시간 만에 전체 설계 및 스케일링을 완료합니다.
  • As-ViT는 ImageNet-1k에서 83.5%의 top-1 정확도와 COCO 객체 검출에서 52.7%의 mAP를 달성하여 기존 수작업으로 설계된 ViT들을 능가합니다.
  • 점진적 재토크나이제이션 전략은 고정된 굵은 토크나이제이션 대비 훈련 FLOPs를 최대 56.2% 감소시켜 훈련 속도를 크게 향상시킵니다.
  • 프레임워크는 단일 시드 아키텍처에서 시작하여 다양한 파라미터 수를 가진 ViT 변종의 전체 패밀리를 생성하여 하드웨어 제약 조건에 맞는 효율적인 배포를 가능하게 합니다.
  • 이 방법은 복잡도 기반 지표를 사용하여 ViT를 효과적으로 스케일링할 수 있음을 보여주며, 검색 및 설계 단계에서 비용이 많이 드는 훈련 루프를 회피할 수 있음을 입증합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.