Skip to main content
QUICK REVIEW

[論文レビュー] Computation-Efficient Knowledge Distillation via Uncertainty-Aware Mixup

Guodong Xu, Ziwei Liu|arXiv (Cornell University)|Dec 17, 2020
Domain Adaptation and Few-Shot Learning参考文献 39被引用数 6
ひとこと要約

本論文では、情報性の高いサンプルを優先し、知識のコンパクト化を実現する不確実性に配慮したサンプリングと適応的ミックスアップを用いた計算効率の良い知識蒸留手法UNIXKDを提案する。CIFAR100では学習コストを21%削減しながら従来のKDを上回り、ImageNetでは著しく低い計算コストで同様の性能を達成する。

ABSTRACT

Knowledge distillation, which involves extracting the "dark knowledge" from a teacher network to guide the learning of a student network, has emerged as an essential technique for model compression and transfer learning. Unlike previous works that focus on the accuracy of student network, here we study a little-explored but important question, i.e., knowledge distillation efficiency. Our goal is to achieve a performance comparable to conventional knowledge distillation with a lower computation cost during training. We show that the UNcertainty-aware mIXup (UNIX) can serve as a clean yet effective solution. The uncertainty sampling strategy is used to evaluate the informativeness of each training sample. Adaptive mixup is applied to uncertain samples to compact knowledge. We further show that the redundancy of conventional knowledge distillation lies in the excessive learning of easy samples. By combining uncertainty and mixup, our approach reduces the redundancy and makes better use of each query to the teacher network. We validate our approach on CIFAR100 and ImageNet. Notably, with only 79% computation cost, we outperform conventional knowledge distillation on CIFAR100 and achieve a comparable result on ImageNet.

研究の動機と目的

  • 知識蒸留(KD)の計算コストを削減するが性能を損なわないという未だ十分に検討されていない問題に取り組む。
  • 容易で高信頼度のサンプルへの過剰な学習に起因する従来のKDにおける冗長性を特定する。
  • 不確実性と知識のコンパクトさに基づいて動的にサンプルの重要性を調整することで、学習効率を向上させる手法を提案する。
  • 教師ネットワークへの不要なクエリを減らすことで、学生モデルの性能を維持または向上させつつ計算コストを低減できることを実証する。

提案手法

  • 学生ネットワークの予測からの不確実性を用いて、サンプルの情報量を推定する。高い不確実性は、分類が難しい情報量の多いサンプルを示す。
  • 適応的ミックスアップを適用:不確実性の高いサンプルには軽いミックスアップを、確実性の高いサンプルには強いミックスアップを施し、知識のコンパクト化を促進する。
  • 混合サンプルからの教師ネットワーク出力(ログティス)をソフトラベルとして用い、学生モデルを監視することで、教師ネットワークの前方伝搬回数を削減する。
  • 効率性を、教師および学生ネットワークにおける前方・逆伝搬の総回数として定義し、異なるKD手法間での直接比較を可能にする。
  • 不確実性サンプリングとミックスアップを統合することで、容易なサンプルにおける冗長な学習を軽減し、境界領域の難易度の高いサンプルでの学習を強化する。
  • オリジナルおよび混合サンプルにおける交差エントロピー損失を組み合わせた損失関数を用いて学生ネットワークを訓練し、ミックスアップの重みを不確実性レベルに応じて調整する。

実験結果

リサーチクエスチョン

  • RQ1学生モデルの性能を損なわず、知識蒸留を計算効率的にすることができるか?
  • RQ2容易なサンプルに対する冗長な学習を減らすことで、全体の蒸留効率が向上するか?
  • RQ3不確実性推定が、選択的知識移転に適した情報量の多いサンプルを効果的に特定できるか?
  • RQ4不確実性に基づく適応的ミックスアップは、知識のコンパクト化とモデルの一般化性能をどのように向上させるか?
  • RQ5学生の精度を維持または向上させつつ、教師の前方伝搬回数をどの程度まで削減できるか?

主な発見

  • UNIXKDはCIFAR100でベースラインの79%(21%のコスト削減)にまで計算コストを削減しながら、従来のKDを上回るトップ1精度を達成した。
  • ImageNetでは、著しく低い計算コストで従来のKDと同等の性能を達成し、強力な一般化性能を示した。
  • 不確実性サンプリングは、カテゴリ中心から離れており、教師のエントロピーが高いサンプルを優先的に選択しており、これが情報量が多く困難であることを裏付けた。
  • 本手法は最初の数エポックでハードカテゴリのサンプリング戦略を素早く学習し、安定して高いサンプル多様性を維持した。
  • サンプリング頻度とカテゴリ難易度の間に強い負の相関が認められ、不確実性に基づくサンプリングにより、難易度の高いカテゴリがより多く選択され、精度が向上した。
  • ランダムサンプリングではカテゴリ間で均等にサンプリングされるが、不確実性サンプリングは難易度の高いサンプルに焦点を当てることで冗長性を低減し、結果として効率性と精度が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。