Skip to main content
QUICK REVIEW

[論文レビュー] Preparing Lessons: Improve Knowledge Distillation with Better Supervision

Tiancheng Wen, Shenqi Lai|arXiv (Cornell University)|Nov 18, 2019
Advanced Neural Network Applications参考文献 51被引用数 20
ひとこと要約

本稿では、誤った教師の予測や過度に不確実な教師の監視を是正することで、知識蒸留の性能を向上させるための知識調整(KA)と動的温度蒸留(DTD)を提案する。KAは、正解ラベルを用いて誤分類された教師の予測を是正する。一方、DTDは、サンプルごとの温度スケーリングを用いて、ソフトラベルの不確実性を低減する。KAとDTDを組み合わせることで、CIFAR-100、CINIC-10、Tiny ImageNetで最先端の性能を達成する。

ABSTRACT

Knowledge distillation (KD) is widely used for training a compact model with the supervision of another large model, which could effectively improve the performance. Previous methods mainly focus on two aspects: 1) training the student to mimic representation space of the teacher; 2) training the model progressively or adding extra module like discriminator. Knowledge from teacher is useful, but it is still not exactly right compared with ground truth. Besides, overly uncertain supervision also influences the result. We introduce two novel approaches, Knowledge Adjustment (KA) and Dynamic Temperature Distillation (DTD), to penalize bad supervision and improve student model. Experiments on CIFAR-100, CINIC-10 and Tiny ImageNet show that our methods get encouraging performance compared with state-of-the-art methods. When combined with other KD-based methods, the performance will be further improved.

研究の動機と目的

  • 知識蒸留における悪質な監視の問題に取り組むこと。具体的には、教師モデルが誤った予測や過度に不確実な予測を行うことによる影響。
  • 教師ネットワークからの監視の質を向上させることで、学生モデルの性能を向上させること。
  • より構造化されたソフトラベルを用いることで、遺伝的誤差を低減し、モデルの識別能力を向上させること。
  • 既存のKDフレームワークと互換性があり、普遍的に適用可能な手法を開発すること。
  • 教師の誤りを是正し、不確実性を低減することが、多様なデータセットにおいて一貫した性能向上をもたらすかどうかを調査すること。

提案手法

  • 知識調整(KA)は、損失計算の前に、誤分類されたサンプルにおける教師の予測を正解ラベルに置き換えることで、教師の予測を是正する。
  • KAは2つの実装形態を採用する:1つはハードラベルによる是正、もう1つはラベル正則化を用いるもので、両者とも正しく監視されるように保証する。
  • 動的温度蒸留(DTD)は、教師からのソフトターゲットにおける不確実性を低減するため、サンプルごとの温度スケーリングを導入する。
  • DTDは予測の信頼度に基づいて、各サンプルごとに温度を動的に調整し、より識別性の高いソフトラベルを促進する。
  • 微分可能かつ適応的な温度を用いたソフトターゲットの計算式を採用することで、学習の安定性が向上する。
  • KAとDTDは標準的なKDと互換性があり、AT や NST などの他の蒸留技術とも組み合わせて利用可能である。

実験結果

リサーチクエスチョン

  • RQ1教師モデルによる誤った監視が、知識蒸留における学生モデルの性能にどのように影響を与えるか?
  • RQ2教師の誤予測を是正することで、学生モデルの一般化性能がどの程度向上し、遺伝的誤差が減少するか?
  • RQ3動的温度スケーリングにより、ソフトラベルの不確実性を低減でき、学生モデルの識別能力が向上するか?
  • RQ4KAとDTDを他のKDベースの手法と組み合わせた場合、性能はどの程度向上するか?
  • RQ5監視の質が、異種の教師-学生設定において蒸留性能に顕著な影響を与えるか?

主な発見

  • KAとDTDは、CIFAR-100、CINIC-10、Tiny ImageNetにおいて独立して精度を向上させ、DTD-KAは最先端の性能を達成した。
  • Tiny ImageNetでは、DTD-KAが最高のトップ-1精度を記録し、他の手法よりも遺伝的誤差を顕著に低減した。
  • AT や NST などの既存手法とKAとDTDを組み合わせることで、さらなる性能向上が得られ、高い互換性が示された。
  • 特にTiny ImageNetでは、遺伝的誤差が顕著に低減され、このデータセットでは教師の誤分類サンプルの割合が高いためにその影響が顕著に現れた。
  • 実験の結果、学生モデルの誤差の約半数が教師の誤った予測に起因していることが判明し、監視の是正の必要性を裏付けた。
  • DTDは、各サンプルごとの温度調整により、ソフトラベルの不確実性を効果的に低減し、より信頼性の高い監視を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。