[論文レビュー] Locality Guidance for Improving Vision Transformers on Tiny Datasets
本論文は、局所的構造を捉える能力に欠けるため、通常は小さなデータセットで性能を発揮しないVision Transformer (VTs) の性能を向上させるために、軽量CNNからの distillation を用いた局所性ガイダンスを提案する。VTをラベルからの学習とCNN特徴の模倣の両方で同時に学習させることで、大規模事前学習を必要とせず、顕著な性能向上が達成される。例えば、DeiTでは+13.07%、T2Tでは+8.98%、PVTでは+7.85%の向上が得られた。
While the Vision Transformer (VT) architecture is becoming trendy in computer vision, pure VT models perform poorly on tiny datasets. To address this issue, this paper proposes the locality guidance for improving the performance of VTs on tiny datasets. We first analyze that the local information, which is of great importance for understanding images, is hard to be learned with limited data due to the high flexibility and intrinsic globality of the self-attention mechanism in VTs. To facilitate local information, we realize the locality guidance for VTs by imitating the features of an already trained convolutional neural network (CNN), inspired by the built-in local-to-global hierarchy of CNN. Under our dual-task learning paradigm, the locality guidance provided by a lightweight CNN trained on low-resolution images is adequate to accelerate the convergence and improve the performance of VTs to a large extent. Therefore, our locality guidance approach is very simple and efficient, and can serve as a basic performance enhancement method for VTs on tiny datasets. Extensive experiments demonstrate that our method can significantly improve VTs when training from scratch on tiny datasets and is compatible with different kinds of VTs and datasets. For example, our proposed method can boost the performance of various VTs on tiny datasets (e.g., 13.07% for DeiT, 8.98% for T2T and 7.85% for PVT), and enhance even stronger baseline PVTv2 by 1.86% to 79.30%, showing the potential of VTs on tiny datasets. The code is available at https://github.com/lkhl/tiny-transformers.
研究の動機と目的
- Vision Transformer (VTs) がグローバルな自己注意機構により局所的画像構造を捉えられず、小さなデータセットで性能が劣る問題に対処する。
- 大規模データが不足する分野(例:医療画像)では大規模事前学習が困難であるため、事前学習・微調整のアプローチの限界を克服する。
- 大規模事前学習やアーキテクチャの変更を必要とせず、シンプルで効率的かつ汎用的な方法を提案し、VTsの小さなデータセットでの性能を向上させる。
- VTsが、限られたデータからスクラッチで学習する場合でも、CNNと同様の階層的局所〜グローバル表現を学習できるようにする。
提案手法
- VTが教師付きラベルと、事前学習済みの軽量CNNからの特徴を模倣することで学習する二重タスク学習フレームワークを導入する。
- 同じデータセットの低解像度画像で学習されたCNNの隠れ層特徴とVTの特徴を一致させることで、知識蒸留を実施する。
- CNNとVTの特徴のチャネル次元を一致させるために、学習可能な線形投影を用い、効果的な特徴蒸留を実現する。
- ハイパーパramータ β を用いて、模倣損失と自己教師学習損失のバランスを調整し、VTがガイダンスされた局所性とタスク固有の表現を両方学習できるようにする。
- CNNの複数層からガイダンス位置を選択し、すべての特徴を使用した場合(R = 1.0)が最良の性能を示し、階層的特徴一致が重要であることを示している。
- ガイドモデルとして軽量CNN(例:ResNet-20, -56, -110)を用い、モデルの複雑さが性能向上に与える影響は最小であることが示された。
実験結果
リサーチクエスチョン
- RQ1大規模事前学習を必要とせず、軽量CNNからの局所性ガイダンスによって、Vision Transformerの小さなデータセットでの性能が向上するか?
- RQ2ガイダンス位置や特徴層選択の選択が、VTの性能向上にどのように影響するか?
- RQ3二重タスク学習フレームワークにおいて、模倣損失と自己教師学習損失の最適なバランスは何か?
- RQ4ガイド用CNNの複雑さが、VTの性能向上に顕著に影響を与えるか?
- RQ5提案手法は、さまざまなVTアーキテクチャやデータセット(医療画像を含む)に一般化可能か?
主な発見
- スクラッチ学習時、DeiTは小さなデータセットで13.07%向上、T2T-ViTは8.98%、PVTは7.85%向上した。
- より強力なベースラインであるPVTv2でも1.86%の向上を示し、CIFAR-100ではトップ1精度79.30%に到達した。
- CNNの全特徴を用いる(R = 1.0)ことで最良の性能が得られ、階層的特徴一致が重要であることを示している。
- 最適なβ値は中程度の範囲内(例:β = 2.0–2.5)にあり、模倣が強すぎず、過剰に支配的にならないことがわかった。
- チャネル一致に学習可能な線形投影を用いることで、固定手法(Attention や Similarity)を上回り、最高で77.29%のトップ1精度を達成した。
- 性能向上は、CNNの複雑さにかかわらず安定しており、ResNet-110をガイドモデルに用いてもVTの精度は76.62%にとどまり、軽量ガイドモデルで十分であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。