Skip to main content
QUICK REVIEW

[論文レビュー] Reducing the Teacher-Student Gap via Spherical Knowledge Disitllation

Jia Guo, Minghao Chen|arXiv (Cornell University)|Oct 15, 2020
Advanced Neural Network Applications参考文献 25被引用数 11
ひとこと要約

本稿では、教師モデルと学生モデルのログティスを単位球面上に正規化する球面知識蒸留(SKD)を提案する。これにより、大規模な教師モデルによる過信予測が引き起こす信頼度のギャップが解消される。大きさではなく方向性の知識に焦点を当てることで、SKDは著しく過小適合を低減し、ResNet50から蒸留されたResNet18でImageNetで73.0%のトップ1精度を達成する。これはより大きなResNet34と同等の性能であり、温度ハイパーパrameterに対して高いロバスト性を示す。

ABSTRACT

Knowledge distillation aims at obtaining a compact and effective model by learning the mapping function from a much larger one. Due to the limited capacity of the student, the student would underfit the teacher. Therefore, student performance would unexpectedly drop when distilling from an oversized teacher, termed the capacity gap problem. We investigate this problem by study the gap of confidence between teacher and student. We find that the magnitude of confidence is not necessary for knowledge distillation and could harm the student performance if the student are forced to learn confidence. We propose Spherical Knowledge Distillation to eliminate this gap explicitly, which eases the underfitting problem. We find this novel knowledge representation can improve compact models with much larger teachers and is robust to temperature. We conducted experiments on both CIFAR100 and ImageNet, and achieve significant improvement. Specifically, we train ResNet18 to 73.0 accuracy, which is a substantial improvement over previous SOTA and is on par with resnet34 almost twice the student size. The implementation has been shared at https://github.com/forjiuzhou/Spherical-Knowledge-Distillation.

研究の動機と目的

  • 知識蒸留における容量ギャップ問題に対処すること。具体的には、過信予測による大規模教師モデルの影響で学生モデルが過小適合する現象を解消すること。
  • 大規模教師モデルにおける信頼度の大きさ(ログティスノルム)が、蒸留過程での学生モデルの性能に悪影響を及えるかどうかを調査すること。
  • 知識蒸留を信頼度の大きさから分離し、ログティスの方向性の類似性にのみ焦点を当てる手法を提案すること。
  • 非常に大規模な教師モデルから蒸留する際の、コンactな学生モデルの一般化性能と訓練安定性を向上させること。
  • 知識蒸留における温度ハイパーパrameterへの依存度を低減すること。

提案手法

  • 球面知識蒸留(SKD)は、教師モデルと学生モデルの両方のログティスを単位長に正規化し、共通の球面上に射影する。
  • この手法により、学生モデルが教師の信頼度の大きさを学ぶ必要がなくなり、ログティスの方向性にのみ注目できる。
  • SKDは、正規化されたログティス(単位ベクトル)間の交差エントロピー損失を用いる。これはクラス確率の方向性を表す。
  • 標準的な知識蒸留フレームワークと互換性があり、最小限のアーキテクチャ変更で適用可能である。
  • ノルムの学習を排除することで、モデル容量が方向性知識の適合に集中でき、一般化性能が向上する。
  • 温度スケーリングに頼らずにソフトマージンを制御できるため、正規化が内在的にソフトネスを制御するため、温度パラメータに対してロバストである。

実験結果

リサーチクエスチョン

  • RQ1大規模教師モデルにおける信頼度の大きさが、知識蒸留過程での学生モデルの性能に悪影響を及えるか?
  • RQ2信頼度の大きさを学ぶ必要をなくすことで、教師と学生の間の容量ギャップを低減できるか?
  • RQ3ログティスの方向性に焦点を当てた知識蒸留が、大きさに注目する場合よりも効果的か?
  • RQ4非常に大規模な教師モデル(例:ResNet152)から蒸留する際、SKDは標準的なKDと比較してどの程度の性能を示すか?
  • RQ5標準KDとは異なり、SKDは温度ハイパーパrameterのチューニングに対してロバストか?

主な発見

  • ResNet50から蒸留されたResNet18を用いて、ImageNetで73.0%のトップ1精度を達成。これはより大きなResNet34と同等の性能である。
  • ResNet152を教師モデルとして用いた場合、SKDは72.70%のトップ1精度を達成し、ベースライン手法を著しく上回る。
  • 過大な教師モデルを用いた際、SKDは訓練損失およびテスト損失の両方をKDよりも効果的に低減しており、最適化および一般化性能の向上を示している。
  • 特に大規模教師モデルを用いる場合、SKDでは教師と学生の正規化ログティス差(MSE損失)がKDよりも顕著に低くなる。
  • SKDは広い温度範囲で安定した性能を示す一方、標準KDは狭い最適範囲外では性能が急激に低下する。
  • SKDはノルム適合誤差を完全に排除し、学生モデルが知識の方向構造にのみ集中できるようになる。これにより性能が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。