Skip to main content
QUICK REVIEW

[論文レビュー] Is Label Smoothing Truly Incompatible with Knowledge Distillation: An Empirical Study

Zhiqiang Shen, Zechun Liu|arXiv (Cornell University)|Apr 1, 2021
Machine Learning and Data Classification参考文献 40被引用数 26
ひとこと要約

本論文はラベルスムージングが知識蒸留と互換性がないわけではないと主張し、スムージングが多くの設定で蒸留を強化する一方で、長尾分布や多クラスの設定では失敗する可能性があることを示す。安定性指標を導入し、視覚領域、BNN、NMTにおける影響を分析する。

ABSTRACT

This work aims to empirically clarify a recently discovered perspective that label smoothing is incompatible with knowledge distillation. We begin by introducing the motivation behind on how this incompatibility is raised, i.e., label smoothing erases relative information between teacher logits. We provide a novel connection on how label smoothing affects distributions of semantically similar and dissimilar classes. Then we propose a metric to quantitatively measure the degree of erased information in sample's representation. After that, we study its one-sidedness and imperfection of the incompatibility view through massive analyses, visualizations and comprehensive experiments on Image Classification, Binary Networks, and Neural Machine Translation. Finally, we broadly discuss several circumstances wherein label smoothing will indeed lose its effectiveness. Project page: http://zhiqiangshen.com/projects/LS_and_KD/index.html.

研究の動機と目的

  • ラベルスムージングと知識蒸留の間で議論されている不適合性を明確にする。
  • 教師モデルにおける内クラス表現とクラス間表現に対するラベルスムージングの影響を説明する。
  • ラベルスムージングによって消失した情報を測定する定量的安定性指標を提案する。
  • ImageNet、CUB200-2011、iMaterialist、二値ネットワーク、NMTにわたってラベルスムージングを用いたKDを実証的に評価する。
  • ラベルスムージングがKDで効果を欠く条件を特定する(長尾分布、多クラスなど)。

提案手法

  • ハードラベルとスムージングラベルで訓練した教師を比較するモデル訓練と可視化。
  • 内クラスの確率分布の分散を測る安定性指標の定義と利用。
  • ハードラベルなしで教師のソフトラベルを用いた知識蒸留の設定(教師と生徒の出力間のKL発散)
  • ImageNet-1K、CUB200-2011、iMaterialist、二値ネットワーク、ドイツ語→英語NMTにわたる広範な実験。
  • KDの監督品質を評価するための異なる教師精度とアーキテクチャによるアブレーション研究。

実験結果

リサーチクエスチョン

  • RQ1教師ネットワークのラベルスムージングは知識蒸留の有効性を抑制するか。
  • RQ2ラベルスムージングは内クラス表現と生徒への知識移転にどう影響するか。
  • RQ3安定性指標は消失した情報を定量化しKDの成功を予測できるか。
  • RQ4どのデータ設定(長尾分布や多クラス)でラベルスムージングはKDに対して効果が低くなるか。
  • RQ5ラベルスムージングを用いる際、知識蒸留におけるより良い教師を決定する要因は何か。

主な発見

  • ラベルスムージングはKDの性能を損なわない。スムージングされた教師は訓練損失が大きくても検証精度が同等またはそれを上回ることがある。
  • より高精度の教師は一般により強い生徒を蒸留するが、関係は必ずしも線形ではなく生徒の容量に依存する。
  • ラベルスムージングは内クラスの分散(安定性)を低減し予測を平坦化する一方、クラス間の関係構造を維持し、同様のクラス間でKDを補助する。
  • 提案された安定性指標はモデルの精度と相関し、KDの教師品質の指標となり得る。
  • 長尾分布とクラス数が多い場合、KDにおけるラベルスムージングの効果は低下する。データセットの複雑さとクラス数によっても結果は異なる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。