Skip to main content
QUICK REVIEW

[논문 리뷰] How to Train Vision Transformer on Small-scale Datasets?

Hanan Gani, Muzammal Naseer|arXiv (Cornell University)|2022. 10. 13.
CCD and CMOS Imaging Sensors인용 수 11
한 줄 요약

이 논문은 소규모 데이터셋에서 직접 인덕티브 바이어스를 학습하는 자기지도 학습 프리트레인 방법을 제안하여, 대규모 프리트레인 없이도 비전 트랜스포머(ViTs)를 효과적으로 초기화함으로써 최신 기술 수준의 성능을 달성한다. 국소적(고해상도) 및 전반적(저해상도) 코너뷰를 사용한 대비 자기지도 학습으로 소규모 데이터셋에서 ViT를 훈련시켜 학습된 특징은 강력한 가중치 초기화로 기능하며, CIFAR10/100, Tiny-ImageNet, Aircraft 및 Cars와 같은 세분화된 데이터셋에서 기존 방법을 능가한다.

ABSTRACT

Vision Transformer (ViT), a radically different architecture than convolutional neural networks offers multiple advantages including design simplicity, robustness and state-of-the-art performance on many vision tasks. However, in contrast to convolutional neural networks, Vision Transformer lacks inherent inductive biases. Therefore, successful training of such models is mainly attributed to pre-training on large-scale datasets such as ImageNet with 1.2M or JFT with 300M images. This hinders the direct adaption of Vision Transformer for small-scale datasets. In this work, we show that self-supervised inductive biases can be learned directly from small-scale datasets and serve as an effective weight initialization scheme for fine-tuning. This allows to train these models without large-scale pre-training, changes to model architecture or loss functions. We present thorough experiments to successfully train monolithic and non-monolithic Vision Transformers on five small datasets including CIFAR10/100, CINIC10, SVHN, Tiny-ImageNet and two fine-grained datasets: Aircraft and Cars. Our approach consistently improves the performance of Vision Transformers while retaining their properties such as attention to salient regions and higher robustness. Our codes and pre-trained models are available at: https://github.com/hananshafi/vits-for-small-scale-datasets.

연구 동기 및 목표

  • 소규모 데이터셋에서 비전 트랜스포머(ViTs)를 처음부터 훈련할 때, 인덕티브 바이어스가 부족하여 일반적으로 성능이 열등해지는 문제를 해결하기 위해.
  • 대규모 프리트레인에 의존하지 않고 소규모 데이터셋에서 유용한 인덕티브 바이어스를 직접 학습하는 자기지도 학습 프리트레인 전략을 개발하기 위해.
  • 아키텍처나 손실 함수 수정 없이도 다양한 소규모 데이터셋에서 ViT 성능을 향상시키는 즉시 사용 가능한 초기화 방법을 제공하기 위해.
  • 소규모 데이터에서 자기지도 학습된 특징이 표준 ImageNet 프리트레인보다 더 나은 일반화 능력과 주목할 만한 영역에 대한 주의 집중을 가능하게 함을 입증하기 위해.

제안 방법

  • 국소(고해상도) 및 전반적(저해상도) 패치를 포함한 이중 코너뷰를 사용한 대비 자기지도 학습 목표를 통해 소규모 데이터셋에서 비전 트랜스포머를 훈련시킨다.
  • 두 뷰의 ViT 특징을 공유된 잠재 공간으로 매핑하기 위해 다층퍼셉트론(MLP) 프로젝터 헤드를 사용한다.
  • 양의(증강된) 뷰 간의 일치를 최대화하고 음성 쌍과의 유사도를 최소화하기 위해 대비 손실(예: InfoNCE)을 최적화한다.
  • 아키텍처나 손실 함수 변경 없이도 동일한 소규모 데이터셋에서 감독적 미세조정을 위한 자기지도 학습 모델 가중치를 초기화로 사용한다.
  • 다양한 국소 및 전반적 뷰를 생성하기 위해 무작위 자르기, 색상 왜곡, 크기 조정 등의 데이터 증강 전략을 활용한다.
  • 최적의 구성 요소를 식별하기 위해 다양한 MLP 헤드 크기, 코너비율 조합, 훈련 스케줄을 평가한다.

실험 결과

연구 질문

  • RQ1소규모 데이터셋에서 자기지도 학습 프리트레인을 통해 다운스트림 작업에서 ViT 성능을 향상시키는 데 기여하는 인덕티브 바이어스를 학습할 수 있는가?
  • RQ2소규모 데이터셋에서 ViT를 처음부터 훈련시킬 때, 자기지도 학습 프리트레인은 ImageNet 프리트레인 또는 무작위 초기화보다 어떻게 비교되는가?
  • RQ3자기지도 학습된 ViT 훈련에서 성능에 가장 큰 영향을 미치는 하이퍼파라미터(예: 코너비율, MLP 헤드 크기)는 무엇인가?
  • RQ4제안된 방법은 아키텍처 수정 없이도 다양한 ViT 아키텍처와 소규모 데이터셋에 일반적으로 적용 가능한가?

주요 결과

  • 제안된 자기지도 학습 프리트레인 방법은 CIFAR100에서 79.15%의 상위-1 정확도를 달성하여 이전 최고 기록인 68.29%보다 뛰어나며, 600 에포크 동안 훈련된 바 있다.
  • Tiny-ImageNet에서는 63.36%의 상위-1 정확도를 기록하여 SimCLR를 사용한 이전 최고 기록인 58.87%와 MOCO-V3를 사용한 52.39%를 초월한다.
  • 단지 300 에포크(200개 자기지도 학습 + 100개 감독 미세조정)로도 이전 방법이 600 에포크가 필요했던 것보다 뛰어난 성능을 달성한다.
  • 3층의 MLP 헤드에 1024 차원을 사용할 경우 최고의 성능을 보였으며, 더 큰 헤드(예: 65536)는 과적합을 유도하고 정확도를 떨어뜨린다.
  • 최적의 국소-전반적 코너비율 조합(예: (0.2, 0.4) 및 (0.5, 1.0))은 CIFAR100과 Tiny-ImageNet에서 성능을 크게 향상시킨다.
  • 자기지도 학습 초기화는 주의 맵을 향상시켜 모델이 주목할 만한 영역에 더 잘 집중할 수 있도록 하고 강건성을 높인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.