Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge Squeezed Adversarial Network Compression

Changyong Shu, Peng Li|arXiv (Cornell University)|Apr 10, 2019
Advanced Neural Network Applications参考文献 46被引用数 13
ひとこと要約

本稿では、タスク指向のアテンションメカニズムを介して中間監視を組み込むことで、大規模な教師ネットワークからの知識を圧縮する、新しい知識蒸留手法である知識圧縮敵対的ネットワーク圧縮(KSANC)を提案する。出力分布と中間特徴表現の両方を敵対的に一致させることで、KSANCはCIFAR-10、CIFAR-100、ImageNetにおいて、極めて低い誤差率で最先端の精度を達成し、極端なモデル圧縮下でも優れた性能を発揮する。

ABSTRACT

Deep network compression has been achieved notable progress via knowledge distillation, where a teacher-student learning manner is adopted by using predetermined loss. Recently, more focuses have been transferred to employ the adversarial training to minimize the discrepancy between distributions of output from two networks. However, they always emphasize on result-oriented learning while neglecting the scheme of process-oriented learning, leading to the loss of rich information contained in the whole network pipeline. Inspired by the assumption that, the small network can not perfectly mimic a large one due to the huge gap of network scale, we propose a knowledge transfer method, involving effective intermediate supervision, under the adversarial training framework to learn the student network. To achieve powerful but highly compact intermediate information representation, the squeezed knowledge is realized by task-driven attention mechanism. Then, the transferred knowledge from teacher network could accommodate the size of student network. As a result, the proposed method integrates merits from both process-oriented and result-oriented learning. Extensive experimental results on three typical benchmark datasets, i.e., CIFAR-10, CIFAR-100, and ImageNet, demonstrate that our method achieves highly superior performances against other state-of-the-art methods.

研究の動機と目的

  • 結果志向の学習にのみ焦点を当てる既存の知識蒸留手法の限界を克服するため、プロセス志向の中間監視を組み込むこと。
  • 大規模な教師ネットワークと小規模な学生ネットワークの間の表現ギャップを、効果的な知識圧縮によって低減すること。
  • タスク指向アテンションメカニズムを用いて豊富な中間表現を転送することで、コンactで高性能な学生ネットワークを実現すること。
  • 出力および中間特徴に敵対的正則化を適用することで、学習の安定性と一般化性能を向上させること。
  • 標準ベンチマークで優れた圧縮性能を発揮するとともに、精度の低下を最小限に抑えること。

提案手法

  • 教師ネットワークと学生ネットワーク間の出力分布および中間特徴表現の両方を同時に一致させる二重敵対的訓練フレームワークを導入する。
  • 教師ネットワークの深層部からの知識を的確に圧縮・転送できるように、タスク指向アテンションメカニズムを採用する。
  • 高次元の中間特徴を、小規模な学生ネットワークの能力に適合したコンパクトでタスク関連の表現に圧縮する。
  • 敵対的訓練の安定化と特徴の整合性向上を図るため、カテゴリ正則化子とディスクラミネータ正則化子を組み込む。
  • 中間監視を用いて、知識の転送を最終層だけでなく、ネットワーク全体のパイプラインにわたり学生ネットワークをガイドする。
  • 複数レベルの特徴で、学生と教師の特徴間の分布差を最小化する敵対的損失を適用し、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1中間監視は、圧縮ネットワークにおける結果志向の一致を超えて、知識蒸留の性能を向上させることができるか?
  • RQ2タスク指向アテンションメカニズムは、深層教師ネットワークからコンパクトな学生ネットワークへの知識の圧縮と転送をどの程度効果的に実現できるか?
  • RQ3敵対的訓練によりプロセス志向と結果志向の学習を組み合わせることで、モデル圧縮における一般化性能の向上と精度低下の低減が達成できるか?
  • RQ4アテンション機構による知識圧縮は、小規模ネットワークの蒸留において学習の安定性と収束性を向上させることができるか?
  • RQ5本手法は、標準ベンチマークにおいて、最先端のGANベースの蒸留および知識蒸留手法と比較して、どのように優れているか?

主な発見

  • ResNet-20を学生ネットワークとするCIFAR-100では、KSANCはトップ-1誤差率31.42%を達成し、2番目に優れた手法(TSCAN)の32.57%を1.15%以上上回った。
  • ResNet-18を学生ネットワークとするImageNetでは、KSANCはトップ-1誤差率31.47%を達成し、同じモデルサイズ下でTSCAN(32.72%)およびANC(32.89%)を大きく上回った。
  • ResNet-50を学生ネットワークとするImageNetでは、KSANCはトップ-1誤差率26.79%を達成し、2番目に優れた手法(TSCAN:27.39%)を上回り、さらに教師ネットワーク(ResNet-152:27.63%)の性能をも上回った。
  • 特に学生ネットワークが教師ネットワークに比べて著しく小さい場合に、中間知識の効果的な転送により、学生と教師の間の精度ギャップが顕著に縮小された。
  • アブレーションスタディの結果、知識圧縮による中間監視は、特にパrameter数が少ない環境下で収束の安定性と一般化性能を向上させることを確認した。
  • 複数のデータセットおよびモデルサイズにわたり一貫した優位性を示し、敵対的訓練とタスク指向の知識圧縮を組み合わせることの有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。