Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge Distillation Based on Transformed Teacher Matching

Kaixiang Zheng, En‐hui Yang|arXiv (Cornell University)|Feb 17, 2024
Educational Technology and Assessment被引用数 4
ひとこと要約

本稿では、学生ネットワークからの温度スケーリングを削除することで一般化性能を向上させる、変換教師マッチング(TTM)という知識蒸留手法を提案する。この手法は、内在的な Rényi エントロピー正則化子を導入し、一般化性能を向上させる。さらに、マッチング精度を向上させる、サンプル適応型の拡張版である重み付きTTM(WTTM)を導入し、ResNet-34から蒸留されたResNet-18を用いたImageNet上でのトップ1正答率72.19%を達成し、最先端性能を実現した。

ABSTRACT

As a technique to bridge logit matching and probability distribution matching, temperature scaling plays a pivotal role in knowledge distillation (KD). Conventionally, temperature scaling is applied to both teacher's logits and student's logits in KD. Motivated by some recent works, in this paper, we drop instead temperature scaling on the student side, and systematically study the resulting variant of KD, dubbed transformed teacher matching (TTM). By reinterpreting temperature scaling as a power transform of probability distribution, we show that in comparison with the original KD, TTM has an inherent Rényi entropy term in its objective function, which serves as an extra regularization term. Extensive experiment results demonstrate that thanks to this inherent regularization, TTM leads to trained students with better generalization than the original KD. To further enhance student's capability to match teacher's power transformed probability distribution, we introduce a sample-adaptive weighting coefficient into TTM, yielding a novel distillation approach dubbed weighted TTM (WTTM). It is shown, by comprehensive experiments, that although WTTM is simple, it is effective, improves upon TTM, and achieves state-of-the-art accuracy performance. Our source code is available at https://github.com/zkxufo/TTM.

研究の動機と目的

  • 知識蒸留において、温度スケーリングを教師と学生の両方に適用すべきかどうかを調査すること。
  • 学生ネットワークからの温度スケーリングの削除が、理論的および実験的に及ぼす影響を理解すること。
  • 内在的な正則化を用いて一般化性能とマッチング精度を向上させる、より効果的な蒸留手法を開発すること。
  • 教師と学生の確率分布マッチングを向上させる、サンプル適応型の重み付け機構を提案すること。

提案手法

  • TTMは、学生のログイットから温度スケーリングを削除し、知識蒸留を再定式化することで、温度スケーリングを施した教師出力と未規格化された学生出力の間の交差エントロピー損失とKLダイバージェンスを最小化する。
  • この手法は、温度スケーリングを確率分布のパワー変換として再解釈し、TTMが目的関数に内在的な Rényi エントロピー正則化子を含んでいることを明らかにした。
  • WTTMは、教師の確率分布への影響を、その信頼性と温度に応じて動的に調整するサンプル適応型重み係数 $ U_{1/T}(p^t) $ を導入した。
  • TTMにおけるバランス重み $ \beta $ は、標準KDと同等の相対的損失比を維持するように設定され、公平な比較を保証した。
  • 理論的分析により、学生から温度スケーリングを削除することで正則化効果が生じ、一般化性能が向上することが示された。
  • WTTMは、標準KDと同等の計算複雑度を維持しながら、適応的マッチングにより顕著に性能を向上させた。

実験結果

リサーチクエスチョン

  • RQ1教師にのみ温度スケーリングを適用し、学生には適用しない場合、知識蒸留における一般化性能が向上するか?
  • RQ2この変種の性能向上の背後にある理論的メカニズムは何か? また、標準KDとはどのように異なるか?
  • RQ3サンプル適応型重み付け戦略は、教師と変換された教師分布間のマッチングをさらに向上させられるか?
  • RQ4TTMに内在する Rényi エントロピー正則化子は、学生の予測の滑らかさと一般化性能にどのように影響するか?

主な発見

  • TTMは、学生から温度スケーリングを削除することで生じる内在的な Rényi エントロピー正則化子のおかげで、標準KDよりも優れた一般化性能を達成した。
  • TTMで訓練された学生は、出力分布の平均シャノンエントロピーが顕著に高く、滑らかでより頑健な予測を示した。
  • WTTMは、KDおよびTTMを上回り、ResNet-34から蒸留されたResNet-18がImageNetでトップ1正答率72.19%を達成し、多数の複雑な特徴ベースの蒸留手法を上回った。
  • 交差エントロピー損失が存在しない状況でも、WTTMは同じ損失を用いたKDを上回り、その頑健性と強いインダクティブバイアスを示した。
  • 教師モデルの性能が向上するにつれて、WTTMにおける学生の性能も一貫して向上し、他の手法を上回った。これは、強力なスケーラビリティを示している。
  • WTTMでは、TTMよりも平均KLダイバージェンス $ D(p^t_T || q) $ がより速く低下し、より低い値にまで到達した。これは、変換された教師マッチングがより正確であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。