Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge Distillation as Efficient Pre-training: Faster Convergence, Higher Data-efficiency, and Better Transferability

Ruifei He, Shuyang Sun|arXiv (Cornell University)|Mar 10, 2022
Advanced Neural Network Applications被引用数 6
ひとこと要約

本稿では、特徴表現を特徴ベースの知識蒸留(KD)により、特徴次元の非パrametricなアライメント(SVDを用い、パワー温度スケーリング(PTS)を適用)することで、事前学習済みの教師モデルから学生モデルへと転送する、効率的な事前学習手法であるKDEP(Knowledge Distillation as Efficient Pre-training)を提案する。KDEPは、10倍少ないデータ量と5倍少ない学習時間で、教師あり事前学習と同等の転移性能を達成でき、より高速で、データ効率が良く、より転送可能なモデルの事前学習を可能にする。

ABSTRACT

Large-scale pre-training has been proven to be crucial for various computer vision tasks. However, with the increase of pre-training data amount, model architecture amount, and the private/inaccessible data, it is not very efficient or possible to pre-train all the model architectures on large-scale datasets. In this work, we investigate an alternative strategy for pre-training, namely Knowledge Distillation as Efficient Pre-training (KDEP), aiming to efficiently transfer the learned feature representation from existing pre-trained models to new student models for future downstream tasks. We observe that existing Knowledge Distillation (KD) methods are unsuitable towards pre-training since they normally distill the logits that are going to be discarded when transferred to downstream tasks. To resolve this problem, we propose a feature-based KD method with non-parametric feature dimension aligning. Notably, our method performs comparably with supervised pre-training counterparts in 3 downstream tasks and 9 downstream datasets requiring 10x less data and 5x less pre-training time. Code is available at https://github.com/CVMI-Lab/KDEP.

研究の動機と目的

  • 大規模またはプライベートなデータセット上で、すべてのモデルアーキテクチャに対して事前学習を行うことの非効率性と非現実性に対処すること。
  • 事前学習済みの教師モデルに凝縮された知識が、新しい学生モデルに対して効率的に転送可能かどうかを調査すること。
  • タスク固有のヘッドや学習可能なアダプタを介して間接的に特徴学習を監督する既存のKD手法の限界を克服すること。
  • 教師モデルの表現品質を保持する非パrametricかつパラメータフリーな特徴次元のアライメント手法を開発すること。
  • 事前学習における収束の速さ、データ効率、および転送性の向上を実現すること。

提案手法

  • 教師モデルの最終層の1つ前(penultimate-layer)の特徴を直接用いて、学生モデルの特徴抽出器を監督する特徴ベースの知識蒸留手法を提案する。
  • 特徴次元の非パrametricなアライメントに特異値分解(SVD)を用い、情報損失を最小限に抑える。
  • SVD処理後の特徴におけるチャネル分散の差を軽減するため、パワー温度スケーリング(PTS)を導入し、最適化の安定性を向上させる。
  • アライメントモジュールに学習可能なパラメータを含めず、蒸留中に追加のパラメータや勾配が発生しないようにする。
  • ログティット(logits)ではなく、教師モデルの特徴表現のみを監督信号として用いるため、表現学習に一般化可能である。
  • 少量で多様なデータセット上で事前学習中に蒸留を適用し、学生モデルの初期化を効率的に行う。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留を、教師モデルから学生モデルへの表現転送の戦略として再利用することは可能か?
  • RQ2なぜ既存のKD手法は、ログティットを蒸留するか、パラメトリックなアダプタを用いる場合、事前学習の文脈では失敗するのか?
  • RQ3SVDとPTSによる非パラメトリックな特徴アライメントは、1×1畳み込みのようなパラメトリック手法を上回る性能を示せるか?
  • RQ4KDEPは、転送性能を維持しつつ、データ量と学習時間をどの程度削減できるか?
  • RQ5無ラベルデータの選択(例:オブジェクトレベル対照景レベル)が、KDEPの性能にどのように影響するか?

主な発見

  • KDEPは、ImageNet-1Kの10%のデータ量と4.0時間の学習時間でトップ1精度74.79%を達成し、教師あり事前学習と同等の性能を10倍少ないデータ量と5倍少ない時間で達成した。
  • ImageNet-1Kの10%のデータ量で、KDEP(SVD+PTS)は75.74%の精度を達成し、同じデータ量と時間制約下での教師あり事前学習(71.05%)を上回った。
  • 100%のImageNet-1Kデータ量で、KDEPは78.40%の精度を達成し、教師あり事前学習(77.13%)を上回り、一部の設定ではより大きな教師モデルをも凌駆した。
  • より強力な教師モデル(MS R50)を用いることで、10%のデータ量と180エポックで77.07%の精度を達成し、教師あり事前学習および従来のKDを上回った。
  • ImageNet-1Kは、高いデータ多様性とオブジェクト中心のコンテンツのおかげで、KDEPの最良の性能を示した。一方、テクスチャのみのデータセット(DTD)は多様性が低いため、最も悪い結果を示した。
  • 計算オーバーヘッドはほとんどなく、学習時間とGPUメモリ使用量は教師あり事前学習とほぼ同一であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。