Skip to main content
QUICK REVIEW

[論文レビュー] Residual Knowledge Distillation

Mengya Gao, Yujun Shen|arXiv (Cornell University)|Feb 21, 2020
Advanced Neural Network Applications参考文献 24被引用数 20
ひとこと要約

本稿では、生徒モデルと教師モデルの特徴マップ間の残差誤差を学習する補助モデルを導入することで、知識蒸留を強化する新しいモデル圧縮手法である残差知識蒸留(RKD)を提案する。計算コストを増加させることなく、1つの生徒モデルを生徒と軽量な補助モデルに分割することで、SOTA(最先端)の性能を達成し、ImageNet上でのResNet-18の精度を、先行手法と比較して2.0%向上させた。

ABSTRACT

Knowledge distillation (KD) is one of the most potent ways for model compression. The key idea is to transfer the knowledge from a deep teacher model (T) to a shallower student (S). However, existing methods suffer from performance degradation due to the substantial gap between the learning capacities of S and T. To remedy this problem, this work proposes Residual Knowledge Distillation (RKD), which further distills the knowledge by introducing an assistant (A). Specifically, S is trained to mimic the feature maps of T, and A aids this process by learning the residual error between them. In this way, S and A complement with each other to get better knowledge from T. Furthermore, we devise an effective method to derive S and A from a given model without increasing the total computational cost. Extensive experiments show that our approach achieves appealing results on popular classification datasets, CIFAR-100 and ImageNet, surpassing state-of-the-art methods.

研究の動機と目的

  • 生徒モデルの容量が限られていることによる、生徒モデルと教師モデルの性能差を是正すること。
  • 一対一の模倣に依存するのではなく、二段階の蒸留プロセスを導入することで、知識伝達の効率を向上させること。
  • 生徒モデルと補助モデルの間で計算リソースを割り分けるモデル分離技術を開発し、合計FLOPsを変更しないこと。
  • 軽量な補助モデルが残差誤差を効果的に学習でき、生徒モデルの性能を顕著に向上させられることを実験的に検証すること。
  • AT(アテンション蒸留)を含む他の蒸留手法と組み合わせることで、RKDの汎用性を示すこと。

提案手法

  • 本手法は、生徒Sと教師Tの特徴マップ間の残差誤差を学習する補助モデルAを導入する。
  • 最終的な生徒出力は、SとAの特徴マップの和として構成され、教師の出力とのより良い整合性を実現する。
  • 合計FLOPsを変更しないように保つために、SとAを1つのモデルから導出するモデル分離技術を提案する。
  • 補助モデルAは、その出力とTとSの特徴マップの差(残差)との間のL2損失を最小化するように訓練される。
  • 特徴マップやアテンションマップを含むさまざまな知識タイプと互換性があり、残差誤差が定義できる限り適用可能である。
  • SがTを模倣する一方でAが残差誤差を学習するように訓練することで、一般化性能と精度が向上する。

実験結果

リサーチクエスチョン

  • RQ1生徒と教師の特徴マップ間の残差誤差を学習する補助モデルを導入することで、知識蒸留の性能が向上するか?
  • RQ2RKDにおける二段階の蒸留プロセスは、生徒と教師の容量差に起因する性能劣化を軽減するか?
  • RQ3計算コストを増加させることなく、軽量な補助モデルが顕著な性能向上を達成できるか?
  • RQ4さまざまなデータセットにおいて、KD、FitNets、ATといったSOTAの知識蒸留手法と比較して、RKDはどのように性能を発揮するか?
  • RQ5アテンション蒸留(AT)のような他の蒸留戦略ともRKDを統合できるか?

主な発見

  • ImageNet上では、ResNet-34からResNet-18への知識伝達において、RKDは2.0%のトップ1精度向上を達成し、2番目に良い手法よりも1.2%顕著に優れている。
  • CIFAR-100では、ベースラインのKD手法と比較して、RKDは生徒の精度を2.75%向上させ、教師の性能に非常に近づいた。
  • 生徒の計算コストの6.25%しか占めない軽量な補助モデル(ResNet-18-1/4)を用いることで、RKDは0.87%高い精度を達成し、効率性を示した。
  • 補助モデルが教師と同じサイズ(ResNet-34)であっても、教師の性能に達しないことから、軽量なAが十分かつ最適であることが示された。
  • ATと組み合わせたRKDは、ImageNetで71.54%のトップ1精度を達成し、残差学習戦略が他の蒸留手法に対しても汎用的であることを示した。
  • CIFAR-100における可視化結果から、RKDは特に初期ブロックで、ベースライン手法よりもより判別力の高い特徴マップを生成していることがわかった。これは、効果的な残差誤差学習に起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。