Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Knowledge Distillation via Label Smoothing Regularization

Yuan, Li, Francis E. H. Tay|arXiv (Cornell University)|Sep 25, 2019
Domain Adaptation and Few-Shot Learning参考文献 22被引用数 16
ひとこと要約

本稿では、事前学習済みの教師モデルを必要とせず、自己学習または手動で設計された正則化分布を用いることで生徒モデルの性能向上を実現する、教師なし知識蒸留(Tf-KD)という新規フレームワークを提案する。著者らは、知識蒸留をラベルスムージング正則化と理論的に結びつけ、ソフトラベルが学習された正則化の一種として機能することを示し、追加計算なしに標準的なKDと同等の性能を達成できることを示しており、ImageNetでは最大0.65%のトップ1精度向上を達成した。

ABSTRACT

Knowledge Distillation (KD) aims to distill the knowledge of a cumbersome teacher model into a lightweight student model. Its success is generally attributed to the privileged information on similarities among categories provided by the teacher model, and in this sense, only strong teacher models are deployed to teach weaker students in practice. In this work, we challenge this common belief by following experimental observations: 1) beyond the acknowledgment that the teacher can improve the student, the student can also enhance the teacher significantly by reversing the KD procedure; 2) a poorly-trained teacher with much lower accuracy than the student can still improve the latter significantly. To explain these observations, we provide a theoretical analysis of the relationships between KD and label smoothing regularization. We prove that 1) KD is a type of learned label smoothing regularization and 2) label smoothing regularization provides a virtual teacher model for KD. From these results, we argue that the success of KD is not fully due to the similarity information between categories from teachers, but also to the regularization of soft targets, which is equally or even more important. Based on these analyses, we further propose a novel Teacher-free Knowledge Distillation (Tf-KD) framework, where a student model learns from itself or manuallydesigned regularization distribution. The Tf-KD achieves comparable performance with normal KD from a superior teacher, which is well applied when a stronger teacher model is unavailable. Meanwhile, Tf-KD is generic and can be directly deployed for training deep neural networks. Without any extra computation cost, Tf-KD achieves up to 0.65\% improvement on ImageNet over well-established baseline models, which is superior to label smoothing regularization.

研究の動機と目的

  • 知識蒸留が強力な教師モデルから得られるカテゴリ間の類似性情報に主に依存しているという一般的な信念に挑戦すること。
  • 教師モデルが弱いか、あるいは生徒モデルより悪い場合でも、知識蒸留が依然として有効であるかどうかを調査すること。
  • 知識蒸留をラベルスムージング正則化と理論的に結びつけ、ソフトラベルの正則化的役割を明らかにすること。
  • 教師モデルを必要としない汎用的かつ計算コストのない知識蒸留手法を提案すること。
  • 自己学習または手動で設計された仮想教師が、標準的なKDと同等の性能を達成できることを検証すること。

提案手法

  • 教師モデルの必要性を排除するため、生徒モデル自身の予測をソフトラベルとして用いることで、教師なし知識蒸留(Tf-KD)をフレームワークとして提案する。
  • Tf-KD regという変種を導入し、正解クラスに99%の確率、他のクラスに一様分布を割り当てた手動で設計されたターゲット分布を用いることで、仮想教師として機能させる。
  • 理論的に、知識蒸留が学習されたラベルスムージング正則化の一種であることを証明し、教師のソフトターゲットがスムージング分布として機能することを示す。
  • ラベルスムージング正則化が、固定された一様な仮想教師を用いたアドホックな知識蒸留と同等であることを示す。
  • 温度スケーリングと交差エントロピー損失およびKLダイバージェンスの重み付き組み合わせを用いて生徒モデルを訓練する。
  • 標準的な訓練プロトコルを用い、複数のデータセット(ImageNet、CIFAR100、Tiny-ImageNet)およびモデル(ResNet、DenseNet、ResNeXt)で手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1強い教師モデルではなく、弱いか、あるいはうまく学習されていない教師モデルであっても、生徒モデルの性能向上に顕著な寄与を示せるか?(一般的な認識とは対照的)
  • RQ2知識蒸留は主に教師モデルが提供するカテゴリ間の類似性情報に依存しているのか、それともソフトラベルによる正則化が同等か、それ以上に重要なのか?
  • RQ3生徒モデルが自身の予測結果をソフトターゲットとして用いることで、別個の教師モデルを必要とせずに有効に学習できるか?
  • RQ4知識蒸留とラベルスムージング正則化の間には理論的関連性があるか?
  • RQ5手動で設計された、情報のない仮想教師(例:一様分布)であっても、標準的なKDと同等の性能を達成できるか?

主な発見

  • 正解クラスに99%の確率を割り当て、他のクラスに一様分布を適用する手動で設計された仮想教師(Tf-KD reg)は、ResNet50に対してImageNetでトップ1精度を0.65%向上させ、標準的なラベルスムージング正則化を上回った。
  • パラメータ数が88.79Mの強力なResNeXt101-32×8dモデルにおいても、Tf-KD regは追加計算コストなしにImageNetで0.48%の精度向上を達成した。
  • CIFAR100では、Tf-KDの自己学習バージョン(Tf-KD self)が、精度を81.03%から82.08%まで向上させ、小規模データセットでも優れた性能を示した。
  • Tf-KD regは、ImageNet、CIFAR100、Tiny-ImageNetを含むすべての評価済みデータセットで、標準的なラベルスムージング正則化を常に上回った。
  • 理論的分析により、知識蒸留が学習されたラベルスムージング正則化の一種であることが確認され、教師のソフトターゲットがスムージング分布として機能することが示された。
  • KDの成功は、カテゴリ間の類似性情報に起因するのではなく、ソフトラベルによる正則化効果が顕著に寄与しており、その重要性は同等か、それ以上であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。