[論文レビュー] MSD: Multi-Self-Distillation Learning via Multi-classifiers within Deep Neural Networks
本稿では、深層ニューラルネットワークにおける複数の分類器が知識蒸留を通じて協同的に学習できるようにすることで、精度を向上させる訓練フレームワークであるマルチ・セルフ・ディスティルレーション(MSD)を提案する。三つの損失関数(教師あり損失、予測倣い損失、特徴量の類似損失)を適用することで、MSDはマルチ・クラスファイアーネットワーク(例:MSDNet)および単一クラスファイアーネットワーク(例:ResNet)に追加された早期分類器を備えた構造に対しても、最初の分類器で最大8.5%の精度向上、全分類器の平均で1%以上の向上を達成する。
As the development of neural networks, more and more deep neural networks are adopted in various tasks, such as image classification. However, as the huge computational overhead, these networks could not be applied on mobile devices or other low latency scenes. To address this dilemma, multi-classifier convolutional network is proposed to allow faster inference via early classifiers with the corresponding classifiers. These networks utilize sophisticated designing to increase the early classifier accuracy. However, naively training the multi-classifier network could hurt the performance (accuracy) of deep neural networks as early classifiers throughout interfere with the feature generation process. In this paper, we propose a general training framework named multi-self-distillation learning (MSD), which mining knowledge of different classifiers within the same network and increase every classifier accuracy. Our approach can be applied not only to multi-classifier networks, but also modern CNNs (e.g., ResNet Series) augmented with additional side branch classifiers. We use sampling-based branch augmentation technique to transform a single-classifier network into a multi-classifier network. This reduces the gap of capacity between different classifiers, and improves the effectiveness of applying MSD. Our experiments show that MSD improves the accuracy of various networks: enhancing the accuracy of every classifier significantly for existing multi-classifier network (MSDNet), improving vanilla single-classifier networks with internal classifiers with high accuracy, while also improving the final accuracy.
研究の動機と目的
- 早期分類器が特徴学習に干渉することで生じるマルチ・クラスファイアーネットワークにおける性能低下を是正すること。
- 外部の学生モデルを必要とせず、1つのネットワーク内に存在する複数の分類器同士で知識を共有可能にすること。
- 特にリソース制約のある推論環境において、早期および最終分類器の両方の精度を向上させること。
- サンプリングに基づくブランンチ拡張技術を用いて、単一分類器ネットワークを効果的なマルチ・クラスファイアーネットワークに拡張すること。
提案手法
- ネットワーク内のすべての分類器が生徒モデルとして機能するマルチ・セルフ・ディスティルレーション(MSD)フレームワークを導入し、相互に知識蒸留を通じて学習させる。
- 各分類器を三つの損失関数で訓練する:交差エントロピー(教師あり)、予測倣い(分類器間のクラス事後確率を一致)、特徴量の類似(最も深い分類器との特徴マップを一致)。
- 異種の分類器(浅いものと深いもの)間で特徴量の類似損失を適用し、知識の転送を促進し、より深いネットワークへのバイアスを低減する。
- 容量バランスを保つために、サンプリングに基づくブランンチ拡張法を用いて、単一分類器ネットワークに適切なグループ境界で早期分類器ブランンチを挿入する。
- 任意の早期分類器ブランチでネットワークを終了できるように動的推論を実装し、容易な入力に対しては高速な推論を可能にする。
- 元のネットワークアーキテクチャおよび訓練ハイパーパrameterを維持し、MSDをプラグイン方式の訓練戦略として適用する。
実験結果
リサーチクエスチョン
- RQ1内部の分類器同士での知識蒸留が、マルチ・クラスファイアーネットワークの全段階における精度向上に寄与するか?
- RQ2分類器間の協同学習が干渉を低減させ、特徴表現の質を向上させるか?
- RQ3MSDが単一分類器ネットワークに効果的に適用可能で、高精度なマルチ・クラスファイアーパathを構築できるか?
- RQ4従来の自己蒸留や共同訓練と比較して、MSDの精度および訓練効率はどのように異なるか?
- RQ5特徴量の類似損失および予測倣い損失が分類器の性能と一般化能力に与える影響は何か?
主な発見
- CIFAR100において、MSDNetの全分類器の精度が平均1%以上向上し、最初の分類器では共同学習に比べて最大1.73%の向上を達成した。
- ResNet18では、MSDを用いることで最初の分類器が78.93%の精度を達成し、ナーブな学習に比べ1.84%、自己蒸留に比べ1.08%の向上を示した。
- WRN20-8では、自己蒸留に比べ最初の分類器で8.5%の精度向上を達成し、初期の分類器に対して顕著な向上が見られた。
- 全テスト対象ネットワーク(ResNet18、ResNet50など)における最終分類器の精度は、自己蒸留に比べ平均1%向上、ナーブな学習に比べ3.2%向上した。
- 最初の分類器と最終分類器の精度差が顕著に縮小され、知識転送の質が向上し、性能のバランスが取れたことが示された。
- MSDは訓練コストの増加も外部モデルの必要もなしに、これらの向上を達成しており、プラグアンドプレイ式の訓練強化手法として有効である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。