Skip to main content
QUICK REVIEW

[論文レビュー] Respecting Transfer Gap in Knowledge Distillation

Yulei Niu, Long Chen|arXiv (Cornell University)|Oct 23, 2022
Domain Adaptation and Few-Shot Learning被引用数 8
ひとこと要約

本稿では、教師モデルの予測が文脈同値性のため不均衡になる機械ドメインにおいて、傾向スコアが低いサンプルを推定し逆数で重み付けすることで、知識蒸留における転送ギャップを是正する逆確率重み付け蒸留(IPWD)を提案する。IPWDは、CIFAR-100およびImageNetにおいてトップ1精度を0.33%〜0.82%向上させ、特に代表が不足しているクラスにおいて顕著な効果を示す。

ABSTRACT

Knowledge distillation (KD) is essentially a process of transferring a teacher model's behavior, e.g., network response, to a student model. The network response serves as additional supervision to formulate the machine domain, which uses the data collected from the human domain as a transfer set. Traditional KD methods hold an underlying assumption that the data collected in both human domain and machine domain are both independent and identically distributed (IID). We point out that this naive assumption is unrealistic and there is indeed a transfer gap between the two domains. Although the gap offers the student model external knowledge from the machine domain, the imbalanced teacher knowledge would make us incorrectly estimate how much to transfer from teacher to student per sample on the non-IID transfer set. To tackle this challenge, we propose Inverse Probability Weighting Distillation (IPWD) that estimates the propensity score of a training sample belonging to the machine domain, and assigns its inverse amount to compensate for under-represented samples. Experiments on CIFAR-100 and ImageNet demonstrate the effectiveness of IPWD for both two-stage distillation and one-stage self-distillation.

研究の動機と目的

  • 知識蒸留における人間ドメインと機械ドメインが独立同分布(IID)であるという現実的でない仮定に起因するドメインシフトの問題を是正すること。
  • 教師モデルの予測が、クラスバランスデータで学習しても文脈同値性のため不均衡になること、これにより転送ギャップが生じることを特定すること。
  • 機械ドメインにおける教師知識の不均衡を是正することで、代表が不足しているクラスにおける蒸留性能を向上させること。
  • 推定された傾向スコアに基づいて動的にサンプル重みを調整する手法を提案すること。

提案手法

  • 各訓練サンプル $ x $ について、機械ドメインに属する確率を表す傾向スコア $ P(x \mid \text{machine domain}) $ を推定する。
  • 逆確率重み付け(IPW)を適用し、機械ドメインで代表が不足しているサンプルに対して $ 1 / P(x) $ を重みとして割り当てる。
  • 修正されたKLダイバージェンス損失を用いてIPWを蒸留損失に統合する:$ \mathcal{L}_{\text{ipw-dist}} = \sum_i w_i \cdot \text{KL}(T_i(x) \parallel S_i(x)) $、ここで $ w_i = 1 / P(x_i) $ である。
  • 初期学習段階では学生モデルと自己教師モデルが未学習であるため、重み推定が不正確になるおそれがあるため、IPWDを学習の最終75エポックに限定して適用する。
  • 減少するトレードオフ係数 $ \alpha_t $ を持つプログレッシブ蒸留スケジュール(PS-KD)を採用し、IPWDを統合して $ \mathcal{L}_{\text{ps-kd + ipw}} $ を構築する。
  • 標準アーキテクチャ(ResNet、DenseNetなど)を用いて、標準ベンチマーク(CIFAR-100、ImageNet)で学習することで、さまざまな設定における有効性を検証する。

実験結果

リサーチクエスチョン

  • RQ1教師モデルのソフトラベルを用いても、なぜ代表が不足しているクラスでは知識蒸留の性能が低いのか?
  • RQ2文脈同値性に起因する教師モデルの予測の不均衡が、人間ドメインと機械ドメイン間の転送ギャップをどの程度引き起こすのか?
  • RQ3逆傾向スコア重み付けは、知識蒸留における不均衡な知識転送を効果的に是正できるか?
  • RQ4初期段階でIPWDを適用すると、重み推定が不正確であるため性能が劣化するのか?
  • RQ5さまざまなアーキテクチャにおいて、IPWDは既存の蒸留手法と比較して精度、キャリブレーション、ロバストネスの面で優れているか?

主な発見

  • 1段階自己蒸留において、CIFAR-100の4つのアーキテクチャ全体でPS-KDのトップ1精度が0.33%〜0.82%向上した。
  • ResNeXt-29では、最終75エポックにIPWDを適用した結果、83.30%のトップ1精度を達成し、PS-KD(82.72%)および早期段階でのIPWD適用(82.86%)を上回った。
  • IPWDは期待キャリブレーション誤差(ECE)と平均不確実性ランク(AURC)を顕著に低減し、ResNeXt-29ではECEが9.15から4.93に、AURCが39.78から37.49に低下した。
  • 4つのアーキテクチャ(ResNet-18、ResNet-101、DenseNet-121、ResNeXt-29)すべてで一貫した性能向上が確認され、一般化性が裏付けられた。
  • アブレーション実験では、初期段階でのIPWD適用が重み推定の不正確さにより性能を劣化させることを確認し、遅延適用の必要性が裏付けられた。
  • ImageNetでもIPWDは学生の精度とキャリブレーションを向上させ、CIFAR-100を超える複雑な設定でも有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。