Skip to main content
QUICK REVIEW

[論文レビュー] TVT: Training-Free Vision Transformer Search on Tiny Datasets

Zimian Wei, Hengyue Pan|arXiv (Cornell University)|Nov 24, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

TVTは、小さなデータセットにおける知識蒸留のための訓練不要なビジョントランスフォーマー(ViT)アーキテクチャ探索フレームワークを提案する。教師に依存するメトリクス(注目マップ類似度に基づく)と学生の能力を評価するメトリクス(L2正規化された重みを用いる)を活用し、訓練を一切行わずに教師の指導を統合したゼロコストプロキシ評価により、順位一貫性と蒸留精度の両面で最先端の性能を達成する。

ABSTRACT

Training-free Vision Transformer (ViT) architecture search is presented to search for a better ViT with zero-cost proxies. While ViTs achieve significant distillation gains from CNN teacher models on small datasets, the current zero-cost proxies in ViTs do not generalize well to the distillation training paradigm according to our experimental observations. In this paper, for the first time, we investigate how to search in a training-free manner with the help of teacher models and devise an effective Training-free ViT (TVT) search framework. Firstly, we observe that the similarity of attention maps between ViT and ConvNet teachers affects distill accuracy notably. Thus, we present a teacher-aware metric conditioned on the feature attention relations between teacher and student. Additionally, TVT employs the L2-Norm of the student's weights as the student-capability metric to improve ranking consistency. Finally, TVT searches for the best ViT for distilling with ConvNet teachers via our teacher-aware metric and student-capability metric, resulting in impressive gains in efficiency and effectiveness. Extensive experiments on various tiny datasets and search spaces show that our TVT outperforms state-of-the-art training-free search methods. The code will be released.

研究の動機と目的

  • 小さなデータセットにおけるビジョントランスフォーマーの知識蒸留シナリオにおいて、既存のゼロコストプロキシが一般化性能に欠ける問題に対処すること。
  • 探索中に教師モデルの情報を活用できない現行の訓練不要NAS手法の限界を克服すること。
  • 教師-学生の特徴一致と学生モデルの表現能力を両方組み込んだゼロコストプロキシを設計し、探索の有効性を向上させること。
  • 計算コストを最小限に抑えつつ、小さなデータセットで高い蒸留精度を達成する、効率的で訓練不要なViTアーキテクチャ探索を可能にすること。

提案手法

  • 教師に依存するメトリクス($\mathcal{M}_t$)と学生の能力を評価するメトリクス($\mathcal{M}_s$)の2つの構成要素からなる、新しいゼロコストプロキシを導入する。
  • $\mathcal{M}_t$ は、学生のViTとConvNet教師の空間的注目マップ間のL2距離を計算し、特徴表現の類似度を測定する。
  • $\mathcal{M}_s$ は、学生モデルの重みのL2ノルムを用いて、その表現能力を推定する。
  • $\mathcal{M}_t$ と $\mathcal{M}_s$ を、学習可能な重み $\alpha$ と $\beta$ を用いて合成スコアに統合し、教師の指導と学生の能力のバランスをとる。
  • 初期化段階での1回の順伝播のみを用いて、合成されたTVTプロキシスコアに基づき候補となるViTを順位付けすることでアーキテクチャ探索を実行する。
  • 局所性を考慮した知識蒸留とソフトマックス活性化を用いて、事前に定義されたConvNet教師を用いて探索されたViTを微調整する。

実験結果

リサーチクエスチョン

  • RQ1なぜ既存のゼロコストプロキシは、小さなデータセットにおけるビジョントランスフォーマーの知識蒸留シナリオで一般化性能に欠けるのか?
  • RQ2教師モデルの情報を訓練不要なアーキテクチャ探索に効果的に統合することで、蒸留性能を向上させることは可能か?
  • RQ3学生モデルの能力が蒸留精度に与える役割は何か? そして、訓練を伴わずにその能力をどのように定量化できるか?
  • RQ4教師-学生の注目マップ一致と学生の重みの大きさを組み合わせたハイブリッドプロキシは、順位一貫性と探索精度を向上させることができるか?

主な発見

  • CIFAR-100ではTVTが最高のケンダール順位相関(0.76)を達成し、NWOT(0.46)やDSS(0.74)を大きく上回った。Flowersでは0.84の相関を記録し、NWOT(0.57)やDSS(0.72)を上回った。
  • ChaoyangデータセットではTVTが85.83%の蒸留精度を達成し、DSS(85.13%)やNWOT(85.13%)を上回り、優れた探索効果を示した。
  • アブレーションスタディの結果、注目マップに基づく $\mathcal{M}_t$ が最も優れた性能(ケンダール相関 0.46)を示し、MMD法やサンプル関係法を上回った。
  • 最適なハイパーパrameter $\alpha = 2$, $\beta = -3$ が最高の順位一貫性(ケンダール相関 0.67)を達成し、教師信号と学生信号のバランスの重要性を示した。
  • TVTは、vanilla ViTに比べて蒸留精度を最大10%向上させ、探索されたアーキテクチャを用いた知識蒸留の有効性を確認した。
  • TVTは1つの候補あたり1回の順伝播のみを要するため、計算効率を維持しており、訓練やスーパーネット計算を一切行わない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。