Skip to main content
QUICK REVIEW

[論文レビュー] How to Train Vision Transformer on Small-scale Datasets?

Hanan Gani, Muzammal Naseer|arXiv (Cornell University)|Oct 13, 2022
CCD and CMOS Imaging Sensors被引用数 11
ひとこと要約

本論文は、小スケールのデータセットから直接帰納的バイアスを学習する自己教師あり事前学習手法を提案する。この手法により、大規模な事前学習を必要とせず、微調整に適したVision Transformer (ViTs)の初期化が可能となり、最先端の性能が達成される。局所的(高解像度)およびグローバル(低解像度)なクロップビューを用いた対照的自己教師あり学習により、小規模データセット上でViTを学習させることで得られる特徴量が、強力な重み初期化として機能し、CIFAR10/100、Tiny-ImageNet、Aircraft や Cars といった細分化されたデータセットにおいて、従来手法を上回る性能を発揮する。

ABSTRACT

Vision Transformer (ViT), a radically different architecture than convolutional neural networks offers multiple advantages including design simplicity, robustness and state-of-the-art performance on many vision tasks. However, in contrast to convolutional neural networks, Vision Transformer lacks inherent inductive biases. Therefore, successful training of such models is mainly attributed to pre-training on large-scale datasets such as ImageNet with 1.2M or JFT with 300M images. This hinders the direct adaption of Vision Transformer for small-scale datasets. In this work, we show that self-supervised inductive biases can be learned directly from small-scale datasets and serve as an effective weight initialization scheme for fine-tuning. This allows to train these models without large-scale pre-training, changes to model architecture or loss functions. We present thorough experiments to successfully train monolithic and non-monolithic Vision Transformers on five small datasets including CIFAR10/100, CINIC10, SVHN, Tiny-ImageNet and two fine-grained datasets: Aircraft and Cars. Our approach consistently improves the performance of Vision Transformers while retaining their properties such as attention to salient regions and higher robustness. Our codes and pre-trained models are available at: https://github.com/hananshafi/vits-for-small-scale-datasets.

研究の動機と目的

  • 小スケールのデータセットでVision Transformer (ViTs)を訓練する際、帰納的バイアスの欠如により通常は性能が劣るために生じる課題に対処すること。
  • 大規模な事前学習に依存せずに、小スケールのデータセットから有用な帰納的バイアスを直接学習する自己教師あり事前学習戦略を開発すること。
  • アーキテクチャや損失関数の変更なしに、さまざまな小スケールデータセットでViTの性能を向上させる、即挿し可能な初期化手法を提供すること。
  • 自己教師あり特徴量学習が小規模データで行われることで、標準的なImageNet事前学習よりも優れた一般化性能と顕著な領域への注目を実現できることを示すこと。

提案手法

  • 局所的(高解像度)およびグローバル(低解像度)なパッチを用いた二重クロップビューを用いた対照的自己教師あり学習目的関数に従い、小規模データセット上でVision Transformerを学習する。
  • ViT特徴量を両ビューから共有潜在空間にマップするための多層パーセプトロン(MLP)プロジェクターヘッドを用いる。
  • 対照的損失(例:InfoNCE)を最適化して、ポジティブ(変換済み)ビュー間の一致を最大化し、ネガティブペアとの類似度を最小化する。
  • 自己教師ありモデルの重みを、同じ小規模データセット上で教師あり微調整の初期化に使用する。アーキテクチャや損失関数の変更は行わない。
  • 多様な局所的およびグローバルビューを生成するために、ランダムクロッピング、カラージッタリング、リサイズなどのデータ拡張戦略を採用する。
  • 最適な設定を特定するために、さまざまなMLPヘッドサイズ、クロップ比の組み合わせ、トレーニングスケジュールの有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1小スケールのデータセットで自己教師あり事前学習を行うことで、下流タスクにおけるViT性能を向上させる帰納的バイアスを学習できるか?
  • RQ2小スケールデータセットでViTをスクラッチから訓練する際、自己教師あり事前学習はImageNet事前学習やランダム初期化と比較してどのように優れているか?
  • RQ3自己教師ありViT学習における性能に最も顕著に影響を与えるハイパーパrameter(例:クロップ比、MLPヘッドサイズ)は何か?
  • RQ4提案手法は、アーキテクチャの変更なしに、さまざまなViTアーキテクチャおよび小スケールデータセットに普遍的に適用可能か?

主な発見

  • 提案手法はCIFAR100で79.15%のトップ-1正解率を達成し、600エポックで学習された従来のSOTA(68.29%)を上回った。
  • Tiny-ImageNetでは63.36%のトップ-1正解率を達成し、SimCLRを用いた従来のSOTA(58.87%)およびMOCO-V3を用いた52.39%を上回った。
  • 300エポック(200エポックの自己教師あり + 100エポックの教師あり)でしか学習していないにもかかわらず、従来の600エポックを要する手法を上回る最先端の性能を達成した。
  • 3層のMLPヘッド(1024次元)が最良の性能を発揮したが、より大きなヘッド(例:65536)は過学習を引き起こし、正解率を低下させた。
  • 最適な局所的〜グローバルクロップ比の組み合わせ(例:(0.2, 0.4) および (0.5, 1.0))は、CIFAR100およびTiny-ImageNetにおける性能を顕著に向上させた。
  • 自己教師あり初期化により注目マップが改善され、モデルが顕著な画像領域に注目する能力が向上し、頑健性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。