Skip to main content
QUICK REVIEW

[論文レビュー] Vision Transformers in 2022: An Update on Tiny ImageNet

Ethan Huynh|arXiv (Cornell University)|May 21, 2022
Brain Tumor Detection and Classification被引用数 6
ひとこと要約

この論文は、DeiTにインspiredされた標準化されたトレーニングプロトコルに従い、Tiny ImageNet上でVision Transformers(ViT、DeiT、CaiT、Swin)を評価し、Swin-L/4で91.35%の最先端の精度を達成した。本研究は、ImageNet-1kのサブセットとして関連性が高いにもかかわらず、先行研究で無視されがちなTiny ImageNetを含む、転移学習ベンチマークにおける重要な空白を埋めることに貢献している。

ABSTRACT

The recent advances in image transformers have shown impressive results and have largely closed the gap between traditional CNN architectures. The standard procedure is to train on large datasets like ImageNet-21k and then finetune on ImageNet-1k. After finetuning, researches will often consider the transfer learning performance on smaller datasets such as CIFAR-10/100 but have left out Tiny ImageNet. This paper offers an update on vision transformers' performance on Tiny ImageNet. I include Vision Transformer (ViT) , Data Efficient Image Transformer (DeiT), Class Attention in Image Transformer (CaiT), and Swin Transformers. In addition, Swin Transformers beats the current state-of-the-art result with a validation accuracy of 91.35%. Code is available here: https://github.com/ehuynh1106/TinyImageNet-Transformers

研究の動機と目的

  • 転移学習研究において頻繁に省かれてきたTiny ImageNetを評価することで、ビジョントランスフォーマーベンチマークにおけるギャップを埋めること。
  • DeiTのものに類似した一貫したトレーニングレジームに従い、現代のビジョントランスフォーマーがTiny ImageNetにどれほどうまく転移するかを評価すること。
  • アブレーションとハイパーパramータチューニングを通じて、ビジョントランスフォーマーのTiny ImageNetにおける最適なトレーニングセットアップを同定すること。
  • この中規模のデータセット上でのViT、DeiT、CaiT、Swinアーキテクチャ間で、モデル効率性、精度、トレーニングスピードを比較すること。

提案手法

  • 384×384の入力解像度と128のバッチサイズを用い、標準化されたトレーニングプロトコルに従い、ViT、DeiT、CaiT、SwinトランスフォーマーをTiny ImageNetでファインチューニングした。
  • 一般化を向上させるために、指定された確率でMixup、CutMix、Random Erasingといったデータオーグメンテーション技術を適用した。
  • ラベルスムージング(ε=0.1)、確率的深さ(レート=0.1)、AdamWオプティマイザを用い、コサインデイエイドと0.05の重み減衰を適用した。
  • モデルサイズに起因するバッチサイズ制限を克服するため、RTX 3070(8GB VRAM)上で勾配蓄積を用いた。
  • オーグメンテーションおよび正則化技術を削除または置き換えることで、最適なトレーニング設定を同定するためのアブレーションスタディを実施した。
  • SGD(ネステロフモーメンタム付き)といった代替オプティマイザを用い、AdamWとの収束性および精度を比較した。

実験結果

リサーチクエスチョン

  • RQ1DeiTにインスパイされたプロトコルでトレーニングされた場合、ビジョントランスフォーマーはTiny ImageNetでどのように性能を発揮するか?
  • RQ2同じトレーニングレジーム下で、どのビジョントランスフォーマー・アーキテクチャがTiny ImageNetで最高の精度を達成するか?
  • RQ3ビジョントランスフォーマーをTiny ImageNetでトレーニングする際の、データオーグメンテーションと正則化技術の最適な組み合わせは何か?
  • RQ4モデルパラメータ数、FLOPs、レイヤー数は、Tiny ImageNetにおけるトレーニングスループットと性能にどのように相関するか?
  • RQ5RandAugmentと比較して、Model EMA や AutoAugment を使用することで、Tiny ImageNetでの性能が向上するか?

主な発見

  • Swin-L/4がTiny ImageNetで91.35%の最高のバリデーション精度を達成し、新たな最先端の結果を樹立した。
  • DeiT-B/16-Dは87.29%の精度を達成し、全モデルの中で最も速くトレーニングされた。知識蒸留の有効性を示している。
  • RandAugmentを削除すると、テスト精度がわずかに向上(91.35% vs 91.34%)し、収束がより安定した。これは、この設定では冗長である可能性を示唆している。
  • Model EMAは精度を90.83%に低下させた。これは、このデータセットでは性能向上に寄与しないという先行研究の結果と整合している。
  • AutoAugmentおよび2つのクローリング手法(RRCおよびSRC)は性能向上に寄与せず、より単純なオーグメンテーション戦略に劣っていた。
  • パラメータ数およびFLOPsが低くても、CaiT-S/36は最も遅くトレーニングされた。これは、レイヤー数がモデルサイズよりもトレーニングスループットの予測要因として強いことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。