Skip to main content
QUICK REVIEW

[論文レビュー] Online Knowledge Distillation via Multi-branch Diversity Enhancement

Zheng Li, Ying Huang|arXiv (Cornell University)|Oct 2, 2020
Domain Adaptation and Few-Shot Learning参考文献 50被引用数 4
ひとこと要約

本論文は、特徴統合モジュール(FFM)と分類器多様化損失(CD損失)を用いて、複数の学生モデル間の多様性を向上させる、新しいオンライン知識蒸留フレームワークを提案する。複数のブランチからの高レベルの意味的特徴を統合し、特徴の直交性を強制することで、追加の推論コストなしにCIFAR-10/100およびCINIC-10で最先端の性能を達成する。

ABSTRACT

Knowledge distillation is an effective method to transfer the knowledge from the cumbersome teacher model to the lightweight student model. Online knowledge distillation uses the ensembled prediction results of multiple student models as soft targets to train each student model. However, the homogenization problem will lead to difficulty in further improving model performance. In this work, we propose a new distillation method to enhance the diversity among multiple student models. We introduce Feature Fusion Module (FFM), which improves the performance of the attention mechanism in the network by integrating rich semantic information contained in the last block of multiple student models. Furthermore, we use the Classifier Diversification(CD) loss function to strengthen the differences between the student models and deliver a better ensemble result. Extensive experiments proved that our method significantly enhances the diversity among student models and brings better distillation performance. We evaluate our method on three image classification datasets: CIFAR-10/100 and CINIC-10. The results show that our method achieves state-of-the-art performance on these datasets.

研究の動機と目的

  • 複数の学生モデルが類似した表現に収束するオンライン知識蒸留における同質化問題に対処すること。
  • ブランチ間の特徴多様性を高めることで、アンサンブルベースの学生モデルの性能を向上させること。
  • 事前学習済み教師モデルを必要とせず、高精度を維持しながら軽量で効率的な手法を開発すること。
  • グループリーダーを唯一の最終デプロイモデルとして使用することで、画像分類ベンチマークで最先端の性能を達成すること。

提案手法

  • 複数の学生モデルの最後のブロックからの意味的特徴を統合する特徴統合モジュール(FFM)を導入し、注目メカニズムの入力を豊かにする。
  • 学生ブランチ間の直交性を強制することで特徴学習を正則化する分類器多様化(CD)損失関数を採用し、同質化を低減する。
  • m-1個の補助ブランチと1つのグループリーダーを持つ二段階の蒸留フレームワークを採用し、知識をリーダーに蒸留してデプロイする。
  • 補助ブランチのアンサンブル予測をグループリーダーの学習のためのソフトターゲットとして使用し、FFMが多ブランチ特徴統合によって注目品質を向上させる。
  • CD損失を正則化項として適用し、ブランチ特徴間の類似性をペナルティ化することで、異なる学習パターンを促進する。
  • ハイパーパramータ γ を最適化し、多様性と収束性のバランスを保ち、安定した学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1多ブランチ特徴統合は、オンライン知識蒸留における注目メカニズムの性能向上に寄与するか?
  • RQ2学生ブランチ間で直交特徴学習を強制することで、モデルの同質化が低減し、アンサンブル精度が向上するか?
  • RQ3提案手法は、推論コストを増加させずに画像分類ベンチマークで最先端の性能を達成できるか?
  • RQ4CD損失はハイパーパramータ γ に対してどれほど感受性が高く、どの範囲が最適な性能をもたらすか?

主な発見

  • ResNet-32を用いた場合、CIFAR-100でトップ1誤差率24.84%を達成し、ベースラインより1.68ポイント優れている。
  • ResNet-110では、ベースラインより2.13%、SOTA手法OKDDipより0.35%の誤差低減を達成した。
  • FFMとCD損失の組み合わせにより、FFM単体と比較してトップ1誤差率が0.56%低減され、両者の有効性が示された。
  • CD損失が最も影響力が大きく、あらゆるバックボーンネットワークとデータセットで性能向上をもたらした。
  • γ の値の広い範囲で安定した性能を維持しており、ハイパーパramータ選定の安定性が示された。
  • CINIC-10でも最先端の結果を達成し、異なるデータセットへの一般化能力を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。