Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Training of Visual Transformers with Small-Size Datasets

Yahui Liu, Enver Sangineto|arXiv (Cornell University)|2021. 06. 07.
Advanced Neural Network Applications참고 문헌 75인용 수 12
한 줄 요약

이 논문은 소규모 데이터 환경에서 Visual Transformer(VTs)의 성능을 향상시키기 위해 공간 관계 학습을 장려하는 경량의 자기지도 학습 태스크를 제안한다. 이는 최소한의 계산 비용으로 이루어지며, 표준 지도 학습과 조합될 경우 다양한 아키텍처와 벤치마크에서 VT의 강건성과 정확도를 크게 향상시킨다.

ABSTRACT

Visual Transformers (VTs) are emerging as an architectural paradigm alternative to Convolutional networks (CNNs). Differently from CNNs, VTs can capture global relations between image elements and they potentially have a larger representation capacity. However, the lack of the typical convolutional inductive bias makes these models more data-hungry than common CNNs. In fact, some local properties of the visual domain which are embedded in the CNN architectural design, in VTs should be learned from samples. In this paper, we empirically analyse different VTs, comparing their robustness in a small training-set regime, and we show that, despite having a comparable accuracy when trained on ImageNet, their performance on smaller datasets can be largely different. Moreover, we propose a self-supervised task which can extract additional information from images with only a negligible computational overhead. This task encourages the VTs to learn spatial relations within an image and makes the VT training much more robust when training data are scarce. Our task is used jointly with the standard (supervised) training and it does not depend on specific architectural choices, thus it can be easily plugged in the existing VTs. Using an extensive evaluation with different VTs and datasets, we show that our method can improve (sometimes dramatically) the final accuracy of the VTs. The code will be available upon acceptance.

연구 동기 및 목표

  • CNN의 인덕티브 바이어스가 부족하여 데이터 소비가 심한 Vision Transformers(VTs)의 문제를 해결한다. 이는 소규모 데이터셋에서 성능이 열등해지는 데 기인한다.
  • 비슷한 ImageNet 정확도를 달성함에도 불구하고, VT가 소규모 학습 세트에서 성능 변동성이 크다는 이유를 규명한다.
  • 아키텍처 변경 없이도 데이터 부족 상황에서 VT의 일반화 능력을 향상시키는 자기지도 학습 컴포넌트를 개발한다.
  • 기존 VT 아키텍처 및 학습 파이프라인과 호환되는 즉시 사용이 가능한 방법을 확보한다.

제안 방법

  • 이미지 내의 패치를 마스킹한 후 전반적인 맥락을 바탕으로 예측하도록 유도하는 자기지도 학습 태스크를 도입하여, Vision Transformers가 공간 관계를 학습하도록 유도한다.
  • 표준 지도 학습의 교차 엔트로피 손실과 함께 보조 손실로 자기지도 학습 태스크를 통합한다.
  • 예측 또는 미세조정 단계에서 최소한의 계산 오버헤드로 자기지도 학습 태스크를 적용한다.
  • 표준 VT 백본(예: ViT)을 사용하며, 동일한 입력 데이터를 바탕으로 지도 학습 및 자기지도 학습 목표를 동시에 학습한다.
  • 아키텍처에 종속되지 않는 자기지도 학습 태스크를 설계하여 기존 VT 프레임워크에 쉽게 통합할 수 있도록 한다.
  • 표준 최적화 프로토콜을 사용하며, 자기지도 학습 손실을 주 분류 목표와 균형을 이루도록 가중치를 조정한다.

실험 결과

연구 질문

  • RQ1비슷한 ImageNet 정확도를 달성함에도 불구하고, 다양한 Vision Transformer 아키텍처가 소규모 데이터셋에서 어떻게 성능을 내는가?
  • RQ2경량 자기지도 학습 태스크가 저데이터 환경에서 VT의 강건성을 향상시킬 수 있는가?
  • RQ3제안된 자기지도 학습 태스크는 계산 비용을 증가시키지 않으면서도 VT의 공간 이해 능력을 향상시킬 수 있는가?
  • RQ4이 방법은 다양한 VT 아키텍처와 데이터셋에 얼마나 일반화될 수 있는가?

주요 결과

  • Vision Transformers는 ImageNet에서 유사한 정확도를 달성함에도 불구하고, 소규모 데이터셋에서 성능 변동성이 뚜렷하게 나타난다.
  • 제안된 자기지도 학습 태스크는 소규모 데이터셋에서 VT의 정확도를 향상시키며, 다양한 아키텍처에서 유사한 개선 효과를 보였다.
  • CIFAR-100 및 Stanford Cars와 같은 벤치마크에서 제한된 학습 데이터로도 정확도 향상이 두드러지게 관찰되었으며, 경우에 따라 극적인 향상이 이루어졌다.
  • 자기지도 학습 컴포넌트는 최소한의 계산 오버헤드만을 유발하여 실세계 적용에 실용적이다.
  • 이 방법은 기반 아키텍처에 관계없이 효과적이며, 넓은 호환성과 즉시 사용이 가능한 사용성을 입증하였다.
  • 자기지도 학습 태스크와 함께 공동 학습을 수행할 경우, 특히 데이터가 부족한 환경에서 더 나은 특징 학습과 일반화 능력 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.