Skip to main content
QUICK REVIEW

[論文レビュー] Few Sample Knowledge Distillation for Efficient Network Compression

Tian-Hong Li, Jianguo Li|arXiv (Cornell University)|Dec 5, 2018
Advanced Neural Network Applications参考文献 39被引用数 16
ひとこと要約

本稿では、学習データの1%のみを用いて、ラベルなしでデータ効率的な深層ニューラルネットワークの圧縮を実現する、Few-Sample Knowledge Distillation (FSKD) を提案する。1×1畳み込み層をブロック出力に追加・最適化することで、最小二乗回帰を用いて学生モデルと教師モデルの特徴を一致させることで、追加の推論コストなしに数分で微調整レベルの精度に回復させ、従来の distillation や微調整手法よりも低データ環境下で優れた性能を発揮する。

ABSTRACT

Deep neural network compression techniques such as pruning and weight tensor decomposition usually require fine-tuning to recover the prediction accuracy when the compression ratio is high. However, conventional fine-tuning suffers from the requirement of a large training set and the time-consuming training procedure. This paper proposes a novel solution for knowledge distillation from label-free few samples to realize both data efficiency and training/processing efficiency. We treat the original network as "teacher-net" and the compressed network as "student-net". A 1x1 convolution layer is added at the end of each layer block of the student-net, and we fit the block-level outputs of the student-net to the teacher-net by estimating the parameters of the added layers. We prove that the added layer can be merged without adding extra parameters and computation cost during inference. Experiments on multiple datasets and network architectures verify the method's effectiveness on student-nets obtained by various network pruning and weight decomposition methods. Our method can recover student-net's accuracy to the same level as conventional fine-tuning methods in minutes while using only 1% label-free data of the full training data.

研究の動機と目的

  • ラベル付きデータが乏しいもしくは存在しない高圧縮・低データ環境における従来の微調整の非効率性に対処する。
  • 大規模なラベル付きデータセットを必要とせずに、圧縮または分解された学生ネットワークの精度回復を効率的に行う。
  • 学習効率と推論効率の両方を高める手法を開発し、計算およびデータのオーバーヘッドを最小限に抑える。
  • さまざまなネットワークアーキテクチャおよび圧縮手法(プルーニング、分解)に適用可能であることを示す。
  • ラベルなしデータのみを共有可能なオンデバイスまたはプライバシー保護型モデル圧縮を可能にする。

提案手法

  • 既存のプルーニングや重み分解手法を用いて教師ネットワークを学生ネットワークに圧縮し、対応するブロックレベル特徴マップの次元を一致させる。
  • 学生ネットワークの各ブロックの最後に、学習可能な1×1畳み込み層を追加し、そのブロック出力を教師ネットワークの出力と一致させる。
  • ラベルなしの少量のデータ上で最小二乗回帰を用いて追加された1×1畳み込み層のパラメータを最適化し、学生ネットワーク全体の逆誤差伝播を回避する。
  • 追加された1×1畳み込み層が、推論時にパラメータ数やFLOPsを増加させずに、直前の畳み込み層に統合可能であることを証明する。
  • ブロックごとの最適化(BCD)を用いて1×1畳み込み層の重みを最適化し、標準的なSGDベースのdistillationと比較して、より少ないサンプルでより高速に収束する。
  • 自動的に圧縮された学生ネットワーク(プルーニング/分解を用いて)およびランダム初期化された手動設計のネットワークの両方へ本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ11%のフルトレーニングデータのみを用いて、ラベルなしで知識蒸留が圧縮ネットワークの精度回復を可能にするか?
  • RQ2提案手法は、大幅に高速かつデータ効率的でありながら、フル微調整と同等の性能を達成するか?
  • RQ3本手法は、さまざまなネットワークアーキテクチャおよび圧縮手法(例:プルーニング、分解)に普遍的に適用可能か?
  • RQ4低データ環境下において、FitNetなどの既存の蒸留手法と比較してFSKDはどのように差をつけるか?
  • RQ5少数のサンプルがトレーニングデータとは異なるクラス分布からのものであっても、FSKDは有効に機能するか?

主な発見

  • FSKD は、ラベルなしの蒸留を経て、フルトレーニングデータの1%のみを用いて、従来の微調整と同等の精度回復を達成する。
  • CIFAR-10 および CIFAR-100 において、少数のサンプルが異なるクラス分布からのものであっても、FSKD はラベルなし一般化を示し、同等の精度回復を達成する。
  • ランダム初期化された手動設計の学生ネットワークにおいて、FSKD は SGD や [21]、[27]、FitNet を上回り、MNIST で200サンプルで97.8%の精度を達成(FitNetの96.5%を上回る)。
  • 追加された1×1畳み込み層のパラメータ数が非常に少ないため、BCDを用いることでSGDベースの蒸留よりも高速かつ高精度に収束する。
  • 追加された1×1畳み込み層を前の層に統合することで、推論時に実行時間のオーバーヘッドが生じないため、推論効率が維持される。
  • 複数のデータセット(CIFAR-10、CIFAR-100、MNIST)およびネットワークアーキテクチャにわたり、本手法は頑健であり、広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。