[論文レビュー] DSD: Regularizing Deep Neural Networks with Dense-Sparse-Dense Training Flow.
DSDは、密度の高いネットワークを最初に訓練し、スパarsity制約の下で重要でない接続を pruning し、その後、pruning された重みを再初期化してから、完全な密度の高いネットワークを再訓練する3段階のトレーニングフローである。この手法は、推論コストを増加させることなく、畳み込みニューラルネットワーク(CNN)、再帰ニューラルネットワーク(RNN)、LSTM において画像分類、音声認識、キャプション生成のタスクで精度を向上させる。
Modern deep neural networks have a large number of parameters, making them very powerful machine learning systems. A critical issue for training such large networks on large-scale data-sets is to prevent overfitting while at the same time providing enough model capacity. We propose DSD, a dense-sparse-dense training flow, for regularizing deep neural networks. In the first D step, we train a dense network to learn which connections are important. In the S step, we regularize the network by pruning the unimportant connections and retrain the network given the sparsity constraint. In the final D step, we increase the model capacity by freeing the sparsity constraint, re-initializing the pruned parameters, and retraining the whole dense network. Experiments show that DSD training can improve the performance of a wide range of CNN, RNN and LSTMs on the tasks of image classification, caption generation and speech recognition. On the Imagenet dataset, DSD improved the absolute accuracy of AlexNet, GoogleNet, VGG-16, ResNet50, ResNet-152 and SqueezeNet by a geo-mean of 2.1 points (Top-1) and 1.4 points (Top-5). On the WSJ’92 and WSJ’93 dataset, DSD improved DeepSpeech2 WER by 0.53 and 1.08 points. On the Flickr-8K dataset, DSD improved the NeuralTalk BLEU score by 2.0 points. DSD training flow produces the same model architecture and doesn’t incur any inference overhead.
研究の動機と目的
- 大規模データセット上で学習された大規模な深層ニューラルネットワークにおける過学習を軽減する一方で、モデル容量を維持すること。
- モデルの複雑さや推論コストを増加させることなく一般化性能を向上させる正則化手法を開発すること。
- 構造的pruningとその後の再訓練が、多様なアーキテクチャとタスクにおいて性能を向上させることを検証すること。
- 動的スパarsityを介して一般化性能を向上させるが、最終的なモデルアーキテクチャを同じままに保つトレーニングフローを設計すること。
提案手法
- 最初のD段階では、標準的な誤差逆伝播法を用いて、完全に接続された(密度の高い)ネットワークを訓練し、重要な接続を特定する。
- S段階では、重みの絶対値または重要度スコアに基づいて重要でない接続をpruning し、残ったスパースなネットワークをスパarsity制約の下でファインチューニングする。
- 最終的なD段階では、スパarsity制約を解除し、pruning された重みを再初期化し、完全な密度の高いネットワークを再びスクラッチから再訓練する。
- この手法は、CNN、RNN、LSTM などのさまざまなアーキテクチャに適用可能であり、標準的なトレーニングパイプラインと互換性がある。
- トレーニングフローはエンドツーエンド微分可能であり、最終的なモデルアーキテクチャを変更せず、推論オーバーヘッドを追加しない。
実験結果
リサーチクエスチョン
- RQ1密度-スパarsity-密度のトレーニングフローは、多様なアーキテクチャとタスクにおいて深層ニューラルネットワークの一般化性能を向上させることができるか?
- RQ2構造的pruningに続いて再訓練を実施することで、モデルサイズや推論コストを増加させずに性能が向上するか?
- RQ3画像分類、音声認識、キャプション生成のタスクにおいて、DSDは標準的なトレーニングに比べてどの程度の精度向上を達成するか?
- RQ4ImageNet、WSJ、Flickr-8Kといったベンチマークデータセットにおいて、DSDフローは性能をどの程度向上させるか?
主な発見
- ImageNetにおいて、DSDはAlexNet、GoogleNet、VGG-16、ResNet50、ResNet-152、SqueezeNetのトップ-1精度を幾何平均で2.1ポイント向上させた。
- 同じデータセットにおいて、DSDは同様のモデル群のトップ-5精度を幾何平均で1.4ポイント向上させた。
- WSJ’92およびWSJ’93データセットでは、DSDによりDeepSpeech2のWERがそれぞれ0.53ポイントおよび1.08ポイント低下した。
- Flickr-8Kデータセットでは、DSDによりNeuralTalkのBLEUスコアが2.0ポイント向上した。
- DSDトレーニングフローは、同じ最終モデルアーキテクチャを維持しており、追加の推論オーバーヘッドを発生させない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。