Skip to main content
QUICK REVIEW

[論文レビュー] Distilling with Performance Enhanced Students

Jack Turner, Elliot J. Crowley|arXiv (Cornell University)|Oct 24, 2018
Advanced Neural Network Applications参考文献 36被引用数 4
ひとこと要約

本稿では、Fisher pruningと実機のハードウェアプロファイリングを組み合わせることで最適なレイヤー幅を特定し、遅延に配慮した知識蒸留法を提案する。推論速度の階段状パターンを活用することで、同じ遅延条件下で標準的なチャネルプルーニングモデルに比べてトップ-1 ImageNet精度を10%以上向上させ、推論時間を増加させることなく高い精度を達成する。

ABSTRACT

The task of accelerating large neural networks on general purpose hardware has, in recent years, prompted the use of channel pruning to reduce network size. However, the efficacy of pruning based approaches has since been called into question. In this paper, we turn to distillation for model compression---specifically, attention transfer---and develop a simple method for discovering performance enhanced student networks. We combine channel saliency metrics with empirical observations of runtime performance to design more accurate networks for a given latency budget. We apply our methodology to residual and densely-connected networks, and show that we are able to find resource-efficient student networks on different hardware platforms while maintaining very high accuracy. These performance-enhanced student networks achieve up to 10% boosts in top-1 ImageNet accuracy over their channel-pruned counterparts for the same inference time.

研究の動機と目的

  • 一般用途のハードウェア上での非線形な推論時間スケーリングにより、標準的なチャネルプルーニングがしばしば非効率であるという問題に対処すること。
  • 推論時間の代理指標としてFLOPsを使用するという制限を克服すること。これは、ハードウェア固有の性能ボトルネックを捉えられていない。
  • プルーニングと実機プロファイリングを組み合わせることで、高精度かつ低遅延な学生ネットワークを発見する手法を開発すること。
  • 固定された遅延予算内で精度を最大化する性能向上型アーキテクチャを特定することにより、モデル圧縮を改善すること。
  • 本手法の有効性を、複数のハードウェアプラットフォームおよびデータセット上でResNet、WideResNet、DenseNetに対して示すこと。

提案手法

  • 事前に訓練された教師ネットワークに対してFisherプルーニングを適用し、100ステップごとに1つのチャネルを削除し、すべてのプルーナブルなチャネルが削除されるまで繰り返す。
  • ターゲットハードウェア上で実測された推論時間の測定値を用い、デバイスの並列処理が最適に活用される「階段状」のポイントを特定する。
  • これらの最適ポイントにおけるレイヤー幅を選択することで、遅延に配慮した性能最適化された学生アーキテクチャを構築し、FLOPsベースの近似による非最適な選択を回避する。
  • 元の教師ネットワークを用いて特徴表現学習をガイドする知識蒸留とアテンション転送を用いて、得られた学生ネットワークを訓練する。
  • 交差エントロピーに対するアテンション損失の重みを調整するバランス項β(ImageNetでは750、CIFARでは1000に設定)を含む蒸留損失を最適化する。
  • ImageNetでは、SGD(モーメンタム0.9、重み減衰0.0001)を用い、90エポックにわたりコサインスケジュールを適用して学生ネットワークをファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1FLOPsベースの指標では捉えられない、ハードウェア固有の性能最適化されたレイヤー幅を特定できるか?
  • RQ2実機プロファイリングと知識蒸留を組み合わせることで、同じ遅延条件下で標準的なプルーニングよりも高精度な学生ネットワークが得られるか?
  • RQ3エッジデバイス上で遅延を増やさずに、性能向上型の学生ネットワークがどれほど精度を向上させられるか?
  • RQ4本手法は、異なるネットワークアーキテクチャ(例:ResNet、DenseNet、WideResNet)およびデータセット(例:CIFAR-10、ImageNet)にどのようにスケーリングするか?
  • RQ5推論時間の階段状パターンを活用することで、遅延を維持したままネットワーク容量を拡大できるか?

主な発見

  • ResNet-34を用いたImageNetでは、性能向上型学生ネットワークがトップ-1誤差32.29%を達成し、75%のパラメータ圧縮条件下でFisherプルーニングモデル(43.43%)に比べて10%以上の改善を示した。
  • プルーニングモデルのトップ-1誤差が20%増加(43.43%)したにもかかわらず、性能向上型学生ネットワークは同じ推論時間を維持しており、遅延コストなしに性能向上を実現した。
  • ARM Cortex-A57ハードウェア上でも、並列処理の最適利用に起因する非線形かつ階段状の推論時間パターンを捉えることで、最適なレイヤー幅を正確に同定できた。
  • 推論時間を一定に保ったまま、チャネルプルーニングベースラインに比べてトップ-1精度を10%以上向上させた。これは、ハードウェアに配慮したアーキテクチャ探索の価値を裏付けた。
  • プルーニングモデルよりも高いMACsとパラメータ数を有しながらも、遅延プロファイル上の最適ポイントを標的としていたため、同じ推論速度を維持した。
  • 本手法はアーキテクチャおよびデータセットに一般化可能であり、CIFAR-10およびImageNetの両方で、最小限のアーキテクチャ変更で優れた結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。