Skip to main content
QUICK REVIEW

[論文レビュー] Incremental Learning Using a Grow-and-Prune Paradigm with Efficient Neural Networks

Xiaoliang Dai, Hongxu Yin|arXiv (Cornell University)|May 27, 2019
Domain Adaptation and Few-Shot Learning参考文献 40被引用数 8
ひとこと要約

本論文では、新しいデータに効率的に適応できるように、ニューラルネットワークの接続を動的に拡張・削除する脳にインspiredされたインクリメンタル学習フレームワークを提案する。勾配に基づく拡張と重みの大きさに基づく削除を組み合わせることで、学習コストを最大67%削減し、学習から再開するか、微調整するのと比較して、よりコン act なモデルを生成しながら、精度を向上させる。

ABSTRACT

Deep neural networks (DNNs) have become a widely deployed model for numerous machine learning applications. However, their fixed architecture, substantial training cost, and significant model redundancy make it difficult to efficiently update them to accommodate previously unseen data. To solve these problems, we propose an incremental learning framework based on a grow-and-prune neural network synthesis paradigm. When new data arrive, the neural network first grows new connections based on the gradients to increase the network capacity to accommodate new data. Then, the framework iteratively prunes away connections based on the magnitude of weights to enhance network compactness, and hence recover efficiency. Finally, the model rests at a lightweight DNN that is both ready for inference and suitable for future grow-and-prune updates. The proposed framework improves accuracy, shrinks network size, and significantly reduces the additional training cost for incoming data compared to conventional approaches, such as training from scratch and network fine-tuning. For the LeNet-300-100 and LeNet-5 neural network architectures derived for the MNIST dataset, the framework reduces training cost by up to 64% (63%) and 67% (63%) compared to training from scratch (network fine-tuning), respectively. For the ResNet-18 architecture derived for the ImageNet dataset and DeepSpeech2 for the AN4 dataset, the corresponding training cost reductions against training from scratch (network fine-tunning) are 64% (60%) and 67% (62%), respectively. Our derived models contain fewer network parameters but achieve higher accuracy relative to conventional baselines.

研究の動機と目的

  • インクリメンタルなデータを伴う継続的DNN学習における高い計算コストとモデルの冗長性を、実世界の応用において解決する。
  • 従来の再学習や微調整手法の制限である固定アーキテクチャと知識の損失を克服する。
  • 動的なネットワーク拡張と削除を通じて、効率的で正確かつコンパクトなモデル更新を実現する。
  • 推論効率を向上させるとともに、計算コストを削減しながら、モデルの精度を維持または向上させる。

提案手法

  • 新しいデータが到着した際に、勾配に基づく成長を適用してネットワークの接続性を拡張し、未学習の情報に対応できる能力を向上させる。
  • 重みの小さい接続を削除することで、成長後にモデルのコンパクトさを向上させる。
  • 2段階の削除を実装する:将来の更新に適合可能にするための回復可能削除と、厳しいリソース制約下での超コンパクトモデルを実現するための回復不能な削除。
  • 成長と削除のプロセスを、新しいデータでの成長と既存データとの共同学習を交互に繰り返す順次更新パイプラインに統合する。
  • 2段階の学習を実施する:まず20エポック間、新しいデータのみで成長を実施し、その後30エポック間、すべてのデータで共同学習を実施する。
  • すべての手法に回復可能削除を適用して、モデルのコンパクトさを確保するとともに、将来のインクリメンタル更新を可能にする。

実験結果

リサーチクエスチョン

  • RQ1成長と削除のパラダイムは、モデルの精度を維持または向上させながら、インクリメンタル学習における学習コストを効果的に削減できるか?
  • RQ2学習から再開するか、微調整するのと比較して、推論効率とモデルサイズの観点で、本フレームワークはどのように評価されるか?
  • RQ3過パラメータ化されたDNNにおける冗長性を、性能を損なわずどの程度まで削減できるか?
  • RQ4本フレームワークは、LeNet、ResNet-18、DeepSpeech2などの多様なアーキテクチャおよびMNIST、ImageNet、AN4などの多様なデータセットに一般化可能か?
  • RQ5回復可能削除の使用は、将来のインクリメンタル更新におけるモデルの適応可能性を保持するか?

主な発見

  • MNISTにおけるLeNet-300-100では、学習から再開するのと比較して最大64%、微調整するのと比較して63%の学習コスト削減を達成した。
  • MNISTにおけるLeNet-5では、学習から再開するのと比較して最大67%(vs. 学習から再開)、微調整するのと比較して63%(vs. 微調整)の学習コスト削減を達成した。
  • ImageNetにおけるResNet-18では、学習から再開するのと比較して64%、微調整するのと比較して60%の学習コスト削減を達成した。
  • AN4におけるDeepSpeech2では、学習から再開するのと比較して67%(vs. 学習から再開)、微調整するのと比較して62%(vs. 微調整)の学習コスト削減を達成した。
  • 導出されたモデルは、従来のベースラインと比較して高い精度(または低い誤差率)と少ないパラメータ数を達成し、最終更新時点で30%(33%)の高い圧縮比を達成した。
  • 最終更新時(100%データ)において、学習から再開するのと比較して0.7%(0.9%)低いWERと、30%(33%)高い圧縮比を達成し、著しく少ない学習エポック数で実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。