Skip to main content
QUICK REVIEW

[論文レビュー] Do Not Blindly Imitate the Teacher: Using Perturbed Loss for Knowledge Distillation

Rongzhi Zhang, Jiaming Shen|arXiv (Cornell University)|May 8, 2023
Model Reduction and Neural Networks被引用数 5
ひとこと要約

本稿では、マクローリン級数展開を用いて標準的なKLダイバージェンス損失を摂動することで、真のラベルに近い分布を持つ仮想教師を暗黙的に生成することにより、学生モデルの性能を向上させる、新しい知識蒸留損失であるPTLossを提案する。本手法は、分布のずれを最小化するように摂動係数を体系的に最適化することで、5つのデータセットにおいて最先端の蒸留性能を達成する。

ABSTRACT

Knowledge distillation is a popular technique to transfer knowledge from large teacher models to a small student model. Typically, the student learns to imitate the teacher by minimizing the KL divergence of its output distribution with the teacher's output distribution. In this work, we argue that such a learning objective is sub-optimal because there exists a discrepancy between the teacher's output distribution and the ground truth label distribution. Therefore, forcing the student to blindly imitate the unreliable teacher output distribution leads to inferior performance. To this end, we propose a novel knowledge distillation objective PTLoss by first representing the vanilla KL-based distillation loss function via a Maclaurin series and then perturbing the leading-order terms in this series. This perturbed loss implicitly transforms the original teacher into a proxy teacher with a distribution closer to the ground truth distribution. We establish the theoretical connection between this "distribution closeness" and the student model generalizability, which enables us to select the PTLoss's perturbation coefficients in a principled way. Extensive experiments on five datasets demonstrate PTLoss can significantly improve the distillation effectiveness for teachers of various scales.

研究の動機と目的

  • 教師モデルの出力分布が真のラベルから逸れる場合に生じる知識蒸留の性能劣化を是正すること。
  • 教師の出力にバイアスが存在する可能性があるにもかかわらず、学生がその出力を無批判に模倣してしまう標準的なKL損失の限界を克服すること。
  • 蒸留リスクを低減するための摂動係数の体系的選択を可能にする、原理的かつ整合性のある手法を開発すること。
  • 損失関数の摂動がより正確な仮想教師分布をもたらす理論的・実験的根拠を提示すること。
  • 温度スケーリングやラベルスムージングといった既存手法を一般化し、それらを特別なケースとして含むPTLossの汎用性を示すこと。

提案手法

  • 標準的なKLベースの蒸留損失をマクローリン級数展開として表現し、解析的取り扱いを可能にする。
  • マクローリン級数の主要項を摂動することで、より柔軟な損失関数であるPTLossを構築する。
  • 摂動された損失によって誘導される暗黙の出力分布としての「仮想教師」分布を定義し、これは元の教師よりも真のラベルに近い。
  • 検証セット上で仮想教師分布と真のラベル分布の経験的ずれを最小化することで、摂動係数を最適化する。
  • PTLossと蒸留リスクの低減の理論的関連を確立し、一般化境界の改善を示す。
  • PTLossが温度スケーリングやラベルスムージングといった既存手法を特別なケースとして包含することを示す。

実験結果

リサーチクエスチョン

  • RQ1標準的なKL損失関数を摂動することで、蒸留誤差を低減するより正確な仮想教師分布を生成できるか?
  • RQ2損失関数内の摂動係数を体系的に選択することで、仮想教師と真のラベルとの乖離を最小化できるか?
  • RQ3PTLossは、標準的な知識蒸留および既存の損失関数変更手法に比べ、学生モデルの一般化性能において優れているか?
  • RQ4PTLossが、vanilla KL損失と比較して蒸留リスクをなぜ低減するのか、理論的根拠は何か?
  • RQ5PTLossは、温度スケーリングやラベルスムージングといった他の損失関数を一般化して含めることができるか?

主な発見

  • PTLossは、ImageNet、CIFAR-100、ANLIを含む5つの多様なデータセットにおいて、学生モデルの精度を顕著に向上させ、標準的なKL損失および先行の最先端手法を上回った。
  • ANLIベンチマークでは、T5-largeを教師モデルとして用いた場合、標準的なKL損失に比べて2.1%の絶対的精度向上を達成した。
  • CIFAR-100では、視覚タスクに特化して設計されたTf-KD_selfなどのベースライン手法に対しても、PTLossが優れた性能を示した。
  • 教師モデルのサイズが異なる場合にも一貫した向上を示し、教師モデルの能力に依存しない堅牢性を示した。
  • 理論的分析により、PTLossが仮想教師と真のラベル分布のずれを最小化することで、蒸留リスクの境界を低減することを確認した。
  • 実験的検証により、PTLossが温度スケーリングやラベルスムージングの一般化と解釈でき、蒸留目的に対するより細かな制御が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。