Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge distillation via adaptive instance normalization

Jing Yang, Brais Martínez|arXiv (Cornell University)|Mar 9, 2020
Generative Adversarial Networks and Image Synthesis参考文献 43被引用数 16
ひとこと要約

本論文は、教師から生徒ネットワークへのチャネルごとの特徴統計(平均と分散)を、適応的インスタンス正規化(AdaIN)を用いて転送する、新しい知識蒸留手法を提案する。教師が転送された統計の信頼性を評価するフィードバックループを通じて、生徒の統計を精練することで、さまざまなアーキテクチャ、データセット、ドメインにおいて最先端の性能を達成し、ImageNetおよびCIFAR-100における実数値からバイナリーネットワークへの蒸留を含む。

ABSTRACT

This paper addresses the problem of model compression via knowledge distillation. To this end, we propose a new knowledge distillation method based on transferring feature statistics, specifically the channel-wise mean and variance, from the teacher to the student. Our method goes beyond the standard way of enforcing the mean and variance of the student to be similar to those of the teacher through an $L_2$ loss, which we found it to be of limited effectiveness. Specifically, we propose a new loss based on adaptive instance normalization to effectively transfer the feature statistics. The main idea is to transfer the learned statistics back to the teacher via adaptive instance normalization (conditioned on the student) and let the teacher network "evaluate" via a loss whether the statistics learned by the student are reliably transferred. We show that our distillation method outperforms other state-of-the-art distillation methods over a large set of experimental settings including different (a) network architectures, (b) teacher-student capacities, (c) datasets, and (d) domains.

研究の動機と目的

  • 知識蒸留における特徴統計の転送において、標準的なL2損失の限界を解消すること。
  • 教師から生徒ネットワークへのチャネルごとの平均と分散のより効果的な転送を可能にすることで、モデル圧縮を向上させること。
  • 教師が転送された統計の信頼性を評価するフィードバック機構を開発し、学習効率を向上させること。
  • 異なるネットワークアーキテクチャ、教師-生徒の能力比、データセット(CIFAR-10/100、ImageNet)、ドメイン(実数値からバイナリーネットワーク)を含む多様な設定において、一貫した性能向上を示すこと。

提案手法

  • 生徒が学習したチャネルごとの平均と分散を教師に戻すために、適応的インスタンス正規化(AdaIN)に基づく新しい損失関数を提案する。
  • 生徒の統計をスケールおよびシフトパラメータとして用い、教師の特徴マップにインスタンス正規化を適用する。
  • 適応された教師の出力と元の教師の出力との間のL2損失を最小化するように生徒を訓練することで、転送された統計が性能を低下させないことを保証する。
  • 教師からのフィードバック信号を用いて生徒を監視することで、統計転送の自己修正メカニズムを構築する。
  • 標準的な蒸留目的(例:ログティットにおけるKLダイバージェンス)と本手法の損失を統合し、共同最適化を行う。
  • 訓練中はエンドツーエンドで本手法を適用し、生徒のみを更新するが、推論時には教師は固定されたままに保つ。

実験結果

リサーチクエスチョン

  • RQ1教師から生徒へのチャネルごとの特徴統計(平均と分散)の転送が、標準的なL2損失を上回る知識蒸留の性能向上を実現できるか?
  • RQ2生徒から教師へのフィードバックループを生成するために適応的インスタンス正規化を用いることで、統計転送の信頼性と効果性が向上するか?
  • RQ3本手法は、多様なネットワークアーキテクチャおよびデータセットドメインにおいて、最先端の蒸留技術と比較してどのように評価されるか?
  • RQ4実数値からバイナリーネットワークへの蒸留という困難な設定において、本手法は知識転送を効果的に実現できるか?
  • RQ5教師の評価によるフィードバック機構が、標準的な蒸留損失と比較して一般化性能と性能を向上させるか?

主な発見

  • ResNet-34(21.8Mパラメータ)からResNet-18(11.69Mパラメータ)への蒸留において、ImageNet-1Kでトップ1精度71.82%を達成し、CRDやRKDを含むすべてのベースラインを上回った。
  • 同じ設定において、教師と生徒の精度差を2.36%まで縮小したが、CRDでは1.27%にとどまり、本手法は優れた性能向上を示した。
  • ResNet-50(25.56Mパラメータ)からMobileNet(4.23Mパラメータ)への蒸留において、本手法はトップ1精度72.49%を達成し、2番目に良い手法(CRD:71.40%)を1.09ポイント上回った。
  • CIFAR-100における実数値からバイナリーネットワークへの蒸留では、ResNet-34を教師、バイナリーモデルを生徒として用い、トップ1精度70.15%を達成し、次に良い手法(OFD)を2.39ポイント上回った。
  • ImageNet-1Kにおけるバイナリーモデルを用いた蒸留では、トップ1精度70.20%を達成し、KD(56.70%)、AT(58.45%)、CRD(58.25%)を大きく上回った。
  • 本手法は、異なるアーキテクチャ、データセットスケール、ドメインを含むすべての評価設定で一貫して性能を向上させ、強力な一般化性とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。