Skip to main content
QUICK REVIEW

[論文レビュー] LIT: Block-wise Intermediate Representation Training for Model Compression

Animesh Koratana, Daniel Kang|arXiv (Cornell University)|Oct 2, 2018
Advanced Neural Network Applications参考文献 25被引用数 13
ひとこと要約

LITは、幅広く深い教師ネットワークの各ブロックに対して中間表現(IR)をブロック単位で一致させる、新しいモデル圧縮技術である。教師のIRを各学生ブロックの入力として用いることで、学習の安定性が向上し、ResNeXt や VDCNN といった現代的なアーキテクチャを最大5.5倍まで圧縮可能であり、精度に損失が生じない。これは知識蒸留法やヒント学習を凌駕し、GANジェネレータへの応用も初めて実現した。

ABSTRACT

Knowledge distillation (KD) is a popular method for reducing the computational overhead of deep network inference, in which the output of a teacher model is used to train a smaller, faster student model. Hint training (i.e., FitNets) extends KD by regressing a student model's intermediate representation to a teacher model's intermediate representation. In this work, we introduce bLock-wise Intermediate representation Training (LIT), a novel model compression technique that extends the use of intermediate representations in deep network compression, outperforming KD and hint training. LIT has two key ideas: 1) LIT trains a student of the same width (but shallower depth) as the teacher by directly comparing the intermediate representations, and 2) LIT uses the intermediate representation from the previous block in the teacher model as an input to the current student block during training, avoiding unstable intermediate representations in the student network. We show that LIT provides substantial reductions in network depth without loss in accuracy -- for example, LIT can compress a ResNeXt-110 to a ResNeXt-20 (5.5x) on CIFAR10 and a VDCNN-29 to a VDCNN-9 (3.2x) on Amazon Reviews without loss in accuracy, outperforming KD and hint training in network size for a given accuracy. We also show that applying LIT to identical student/teacher architectures increases the accuracy of the student model above the teacher model, outperforming the recently-proposed Born Again Networks procedure on ResNet, ResNeXt, and VDCNN. Finally, we show that LIT can effectively compress GAN generators, which are not supported in the KD framework because GANs output pixels as opposed to probabilities.

研究の動機と目的

  • 知識蒸留における深層学生ネットワークの中間表現(IR)の不安定性を解消すること。
  • 従来のヒント学習やKDでは十分に圧縮されない、現代的で構造が複雑な深層ネットワーク(例:ResNeXt, VDCNN)の有効な圧縮を可能にすること。
  • ピクセルレベルの出力を有するため、標準的なKDと互換性のないGANジェネレータに対しても、学生/教師学習を拡張すること。
  • 教師ネットワークの一部を直接コピーし、教師のIRを学生ブロックの入力として用いることで、高精度でコンパクトな学生モデルを実現すること。
  • 学生と教師のアーキテクチャが同一の場合に、LITが教師モデルを上回る精度を達成できることを示すこと。

提案手法

  • 教師と同一の幅を持つが深さを短縮した学生ネットワークを、ブロック単位の中間表現(IR)マッチングを用いて学習する。
  • 学習中に、前のブロックの教師のIRを現在の学生ブロックの入力として使用することで、内部表現の安定化を図る。
  • ログイットとIRの監視をバランスさせるために、重み付き補間係数βを用いて知識蒸留(KD)損失とIRマッチング損失を組み合わせる。
  • 学生と教師の対応するブロック間でIR損失を適用し、幅と特徴マップの整合性を保証する。
  • 教師から学生にそのままコピー可能なブロックを許容することで、モジュラーなモデル圧縮を可能にする。
  • 残差ブロック内のIRマッチングにより、GANジェネレータの圧縮を可能にし、ピクセル出力のためのKDとの不適合を回避する。

実験結果

リサーチクエスチョン

  • RQ1標準的なヒント学習が、不安定なIRのため失敗するような、ResNeXt や VDCNN のような現代的で非常に深いネットワークに対し、中間表現マッチングを効果的に拡張できるか?
  • RQ2教師が提供するIRを入力としてブロック単位のIR学習を実施することで、標準的なKDやヒント学習と比較して、学生モデルの精度と一般化性能が向上するか?
  • RQ3ピクセルレベルの出力を持つため、標準的な知識蒸留と互換性のないGANジェネレータをLITで圧縮できるか?
  • RQ4学生と教師のアーキテクチャが同一の場合に、LITが教師モデルの精度を超える学生モデルを実現できるか?
  • RQ5LITの性能はβ(IR損失重み)やα(KD損失重み)といったハイパーパrameterにどれほど敏感か?最適な設定は何か?

主な発見

  • CIFAR10でResNeXt-110をResNeXt-20(5.5倍圧縮)に圧縮しても精度に損失がなく、KDやヒント学習を上回った。
  • Amazon ReviewsデータセットでVDCNN-29をVDCNN-9(3.2倍圧縮)に圧縮しても精度に劣化がなく、自然言語処理タスクへの有効性が示された。
  • 同一アーキテクチャを圧縮する際、LITはResNet、ResNeXt、VDCNNの全範囲で教師モデルを上回る学生モデルの精度を達成し、Born Again Networksを凌駆した。
  • 残差ブロック内のIRマッチングにより、GANジェネレータの圧縮が可能となり、GANに適用可能な最初の学生/教師学習手法となった。
  • IRマッチングにSmoothed L1損失を用いると、L1とL2損失と比較して精度が低下し、L1とL2の間には有意な性能差は認められなかった。
  • 混合精度学習はLITの性能にほとんど影響せず、ResNeXtでは0.06%の精度低下に留まり、現代のトレーニング手法と互換性があることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。