Skip to main content
QUICK REVIEW

[論文レビュー] Densely Guided Knowledge Distillation using Multiple Teacher Assistants

Wonchul Son, Jaemin Na|arXiv (Cornell University)|Sep 18, 2020
Advanced Neural Network Applications参考文献 41被引用数 14
ひとこと要約

本論文は、教師モデルと生徒モデルの間の容量差が大きい場合に発生する誤差アバランチ問題を軽減するため、複数の教師アシスタントを用いたDensely Guided Knowledge Distillation (DGKD)を提案する。各小さな教師アシスタントは、以前に訓練済みの上位レベルの教師モデルおよび元の教師モデルから継続的にガイドを受け、知識伝達を強化し、誤差伝搬を低減する。この手法は最先端の性能を達成し、ResNetベースのモデルを用いたCIFAR-100においてTAKDよりも最大5.01%の精度向上を達成した。

ABSTRACT

With the success of deep neural networks, knowledge distillation which guides the learning of a small student network from a large teacher network is being actively studied for model compression and transfer learning. However, few studies have been performed to resolve the poor learning issue of the student network when the student and teacher model sizes significantly differ. In this paper, we propose a densely guided knowledge distillation using multiple teacher assistants that gradually decreases the model size to efficiently bridge the large gap between the teacher and student networks. To stimulate more efficient learning of the student network, we guide each teacher assistant to every other smaller teacher assistants iteratively. Specifically, when teaching a smaller teacher assistant at the next step, the existing larger teacher assistants from the previous step are used as well as the teacher network. Moreover, we design stochastic teaching where, for each mini-batch, a teacher or teacher assistants are randomly dropped. This acts as a regularizer to improve the efficiency of teaching of the student network. Thus, the student can always learn salient distilled knowledge from the multiple sources. We verified the effectiveness of the proposed method for a classification task using CIFAR-10, CIFAR-100, and ImageNet. We also achieved significant performance improvements with various backbone architectures such as ResNet, WideResNet, and VGG.

研究の動機と目的

  • 生徒ネットワークが教師モデルよりも著しく小さい場合に発生する知識蒸留における誤差アバランチ問題に対処すること。
  • 教師と生徒の間のモデルサイズギャップが大きい状況での知識伝達効率の向上。
  • 確率的知識蒸留の導入により、生徒の訓練中の過学習を軽減すること。
  • 複数の中間教師アシスタントを用いることで、より強固でスケーラブルな蒸留経路を実現すること。

提案手法

  • 本手法は、元の教師モデルから始まり、段階的に容量が減少する複数の教師アシスタント(TAs)の段階的連鎖を採用する。
  • 各TAは、直前のレベルのTAに加え、すべての上位レベルのTAおよび元の教師モデルからの知識蒸留を経て訓練され、密なガイドを実現する。
  • 出力確率と内部表現の両方を伝達するために、ソフトラベルおよび中間特徴マップを用いた知識蒸留を実施する。
  • 確率的指導戦略を導入し、各ミニバッチごとにランダムに選択された教師およびTAのサブセットから知識を蒸留することで、正則化効果を発揮する。
  • 訓練プロセスは、T → A1 → A2 → ... → S の多段階蒸留パスを採用し、各段階で過去のすべての教師を活用することで、より強固な知識伝達を実現する。
  • 本手法は、ResNet、WideResNet、VGGなどの複数のバックボーンアーキテクチャおよびCIFAR-10、CIFAR-100、ImageNetなどの複数のデータセットで評価され、汎用性とスケーラビリティを示した。

実験結果

リサーチクエスチョン

  • RQ1生徒モデルが教師モデルよりも著しく小さい場合に、複数の中間教師アシスタントは知識蒸留の性能を向上させ得るか?
  • RQ2すべての上位レベルの教師モデルおよび元の教師モデルからの密な知識蒸留は、逐次的TA訓練と比較して誤差アバランチ問題を軽減するか?
  • RQ3ランダムに除外された教師からの確率的知識蒸留は、生徒の訓練における一般化性能の向上および過学習の軽減に寄与するか?
  • RQ4本手法は、多様なアーキテクチャおよびデータセットにおいて、最先端のKD手法と比較して精度および耐性面で優れているか?

主な発見

  • 提案された確率的DGKDは、ResNet-18を生徒モデルとして用いたImageNetで92.34%のトップ1精度を達成し、元のDGKDおよびTAKDを上回った。
  • 16×2 WideResNetを生徒モデルとして用いたCIFAR-100では、確率的DGKDが90.54%の精度を達成し、TAKD比で5.01%向上、非確率的DGKD比で1.23%向上を達成した。
  • CIFAR-10で20層のResNetを生徒モデルとして用いた場合、本手法は大容量ギャップ下でも強力な性能を示した。
  • VGG13→VGG8の設定では74.40%の精度を達成し、最先端手法の中でも2位を記録し、中程度のモデルギャップ下でも優れた性能を示した。
  • 評価されたすべてのバックボーンアーキテクチャおよびデータセットにおいて、ベースラインKD、FitNet、AT、SP、RKD、TAKDを一貫して上回った。
  • アブレーションスタディにより、確率的蒸留戦略が一般化性能を顕著に向上させ、過学習を低減し、生徒の性能向上に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。