Skip to main content
QUICK REVIEW

[論文レビュー] DisWOT: Student Architecture Search for Distillation WithOut Training

Peijie Dong, Lujun Li|arXiv (Cornell University)|Mar 28, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

DisWOTは、ランダムに初期化された教師および生徒ネットワーク間の意味的および関係的類似度を測定することで、知識蒸留に最適な生徒モデルを選択するトレーニングフリーのニューラルアーキテクチャサーチフレームワークを提案する。勾配ベースの活性化マップと特徴相関行列を活用することで、標準的なトレーニングに比べて180倍以上の高速化を達成し、最新の知識蒸留性能を実現し、既存のゼロコストNAS手法を上回る。

ABSTRACT

Knowledge distillation (KD) is an effective training strategy to improve the lightweight student models under the guidance of cumbersome teachers. However, the large architecture difference across the teacher-student pairs limits the distillation gains. In contrast to previous adaptive distillation methods to reduce the teacher-student gap, we explore a novel training-free framework to search for the best student architectures for a given teacher. Our work first empirically show that the optimal model under vanilla training cannot be the winner in distillation. Secondly, we find that the similarity of feature semantics and sample relations between random-initialized teacher-student networks have good correlations with final distillation performances. Thus, we efficiently measure similarity matrixs conditioned on the semantic activation maps to select the optimal student via an evolutionary algorithm without any training. In this way, our student architecture search for Distillation WithOut Training (DisWOT) significantly improves the performance of the model in the distillation stage with at least 180$ imes$ training acceleration. Additionally, we extend similarity metrics in DisWOT as new distillers and KD-based zero-proxies. Our experiments on CIFAR, ImageNet and NAS-Bench-201 demonstrate that our technique achieves state-of-the-art results on different search spaces. Our project and code are available at https://lilujunai.github.io/DisWOT-CVPR2023/.

研究の動機と目的

  • 教師モデルと生徒モデルのアーキテクチャの不一致が引き起こす知識蒸留の性能差を是正すること。
  • あらゆるトレーニングを伴わずに、蒸留性能を最大化する生徒アーキテクチャを同定すること。これにより、通常のトレーニングベースのサーチの限界を克服する。
  • 最終的な蒸留精度と強く相関するゼロコストメトリクスを開発し、効率的なアーキテクチャサーチを可能にすること。
  • 教師と生徒ネットワーク間の意味的および関係的整合性を向上させることで、蒸留性能を向上させること。
  • 蒸留に適したスケーラブルなトレーニングフリーの代替手法を提供し、既存のNAS手法に比べてサーチコストを180倍以上削減すること。

提案手法

  • 1回のフォワードおよびバックワードパスからのGrad-CAM活性化マップのチャネルワイド類似度を用いて、教師および生徒ネットワーク間の意味的類似度を測定する。
  • グローバル平均プーリングの前段階の特徴活性化から導出される正規化済みサンプル関係相関行列のL2距離を比較することで、関係的類似度を計算する。
  • 意味的および関係的類似度メトリクスをフィットネススコアとして用い、進化的アルゴリズムを用いて最適な生徒アーキテクチャを探索する。
  • 微調整やトレーニングなしに、ランダムに初期化されたネットワーク(ガウス分布およびヘ初期化)を用いてメトリクスを計算する。
  • 深さ、幅、カーネルサイズを変更可能なResNetに類似したアーキテクチャの定義済みサーチスペースを用い、8で割り切れるチャネル数かつ最大2048チャネルに制限する。
  • 突然変異後の構造的チェックを実施し、サーチ制約内での実行可能性を保証する。

実験結果

リサーチクエスチョン

  • RQ1特徴の意味的性質およびサンプル間関係に基づくトレーニングフリーのメトリクスは、単純な精度や既存のゼロコストプロキシよりも、蒸留性能をより正確に予測できるか?
  • RQ2なぜ高い単独(vanilla)精度を示すモデルが知識蒸留では劣るのか?このギャップを説明するアーキテクチャ的要因は何か?
  • RQ3ランダムに初期化された教師および生徒ネットワーク間の意味的および関係的類似度は、蒸留性能の信頼できる代理指標として機能できるか?
  • RQ4トレーニングフリーのアーキテクチャサーチフレームワークは、蒸留精度を向上させつつ、サーチコストをどの程度削減できるか?
  • RQ5意味的および関係的類似度を指標に用いた場合、深さ、幅、カーネルサイズなどの異なるアーキテクチャ設定が、蒸留性能にどのように影響を与えるか?

主な発見

  • 単独トレーニング下での最適な生徒アーキテクチャが、必ずしも最高の蒸留性能を発揮するわけではない。これは、単独精度と蒸留精度の間に乖離があることを示している。
  • 単独精度は最終的な蒸留性能と85%程度の相関しか示さない。これにより、より優れたサーチプロキシの必要性が浮き彫りになる。
  • ResNet[3,3,3]はResNet[7,1,3]よりも高い単独精度を示したが、蒸留では後者の方が優れていた。これは、より良い受容 field と知識マッチングが要因である。
  • 意味的および関係的類似度メトリクスは、サーチスペース$S_0$において、既存のゼロコストNAS手法よりも蒸留精度とのランク相関が高かった。
  • DisWOTは、CIFAR、ImageNet、NAS-Bench-201の全データセットでSOTAの蒸留性能を達成し、標準的なトレーニングに比べて少なくとも180倍の高速化を実現した。
  • 提案されたメトリクスは、効果的な蒸留器およびゼロプロキシとして機能し、あらゆるトレーニングを伴わずに高精度な生徒モデルの選択が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。