Skip to main content
QUICK REVIEW

[論文レビュー] Compacting Neural Network Classifiers via Dropout Training

Yotaro Kubo, George Tucker|arXiv (Cornell University)|Nov 18, 2016
Speech Recognition and Synthesis参考文献 18被引用数 11
ひとこと要約

この論文では、ユニット固有のドロップアウト保持確率を、0と1に鋭くピークを持つ二峰性事前分布で正則化することで、トレーニング中に不要な隠れユニットを自動的にプルーニングできるドロップアウトコンパクションという手法を紹介している。この手法により、元のパラメータ数の50%未満で、性能劣化を伴わず2.5倍の推論速度向上を達成した。

ABSTRACT

We introduce dropout compaction, a novel method for training feed-forward neural networks which realizes the performance gains of training a large model with dropout regularization, yet extracts a compact neural network for run-time efficiency. In the proposed method, we introduce a sparsity-inducing prior on the per unit dropout retention probability so that the optimizer can effectively prune hidden units during training. By changing the prior hyperparameters, we can control the size of the resulting network. We performed a systematic comparison of dropout compaction and competing methods on several real-world speech recognition tasks and found that dropout compaction achieved comparable accuracy with fewer than 50% of the hidden units, translating to a 2.5x speedup in run-time.

研究の動機と目的

  • ニューラルネットワークのデプロイにおいて、モデル性能と推論効率のトレードオフを解消すること。
  • ドロップアウトの正則化効果を損なわず、トレーニング中に自動的かつ構造的な隠れユニットプルーニングを可能にすること。
  • 後処理による圧縮や再トレーニングを回避し、ネットワーク構造とパラメータを同時に最適化する手法を開発すること。
  • ベースラインや既存のコンパクション技術と比較して、顕著な推論速度向上を達成するとともに、精度を維持または向上させること。
  • ドロップアウト保持率に確率的事前分布を用いることで、ネットワークのスパarsityとコンパクト性を誘導する可能性を検討すること。

提案手法

  • 各ユニットごとにドロップアウト保持確率を導入し、0と1に鋭くピークを持つ二峰性事前分布を用いて、ユニットが常にドロップアウトされるか、常に活性化されるように促進する。
  • 変分推論を用いて保持確率の事後分布を近似し、確率的勾配降下法によるエンドツーエンドのトレーニングを可能にする。
  • ハイパーパrameter α と β を用いたスパarsity誘導型事前分布を導入し、コンパクション率と収束速度を制御する。
  • 各ユニットの決定を0または1に導くために、事前分布のハイパーパrameterにアニーリングスケジュールを適用する。
  • 標準的なバックプロパゲーションを用いてネットワークをトレーニングし、各ユニットの学習済み保持確率に従ってドロップアウトマスクをユニットごとにサンプリングする。
  • 収束後、保持確率がほぼゼロのユニットを削除することで、推論に適したコンパクトで効率的なネットワークが得られる。

実験結果

リサーチクエスチョン

  • RQ1トレーニング中に不要な隠れユニットが自動的にプルーニングされつつ、ドロップアウトの正則化効果が保持されるようなニューラルネットワークのトレーニングは可能か?
  • RQ2ユニットごとのドロップアウト保持確率に確率的事前分布を適用することで、前向きネットワークにおける構造的スパarsityを効果的に誘導できるか?
  • RQ3得られたコンパクトなネットワークは、フルモデルと同等またはそれ以上の精度を達成するか? また、顕著な推論速度向上を実現できるか?
  • RQ4SVDベースのコンパクション、L1プルーニング、知識蒸留といった既存のコンパクション技術と比較して、精度と効率の面で本手法は優れているか?
  • RQ5本手法は、音声認識におけるbMMIのようなシーケンス判別的ファインチューニングを含む標準的なトレーニングパイプラインに効果的に統合可能か?

主な発見

  • ドロップアウトコンパクションは、すべての音声認識タスクでベースラインモデルと同等またはそれ以上の単語誤り率を達成したが、元のパラメータ数の50%未満で実現した。
  • 平均して、隠れユニット数が約50%削減され、推論時間に2.5倍の高速化が達成された。
  • 特に交差エントロピー訓練フェーズでは、SVDベースのコンパクションや知識蒸留よりも優れた性能を示した。
  • シーケンス判別的ファインチューニング(bMMI)後でも、ドロップアウトコンパクションモデルは強く性能を維持しており、標準的なトレーニングワークフローとの互換性があることが示された。
  • 保持確率が11エポック以内に0または1に収束したため、トレーニング中に構造学習が高速かつ安定的に行われた。
  • ドロップアウトコンパクションの最適な事前分布ハイパーパrameterは、18エポックを要するアニーリングドロップアウトよりも収束が速かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。