Skip to main content
QUICK REVIEW

[論文レビュー] GradMax: Growing Neural Networks using Gradient Information

Utku Evci, Bart van Merriënboer|arXiv (Cornell University)|Jan 13, 2022
Neural Networks and Applications被引用数 9
ひとこと要約

GradMaxは、特異値分解(SVD)を用いた最適化初期化により、新しいニューロンを勾配ノルムを最大化するように初期化することで、ニューラルネットワークを成長させる手法を提案する。このアプローチは再訓練を必要とせず、訓練のダイナミクスを改善し、視覚タスクにおいて収束を高速化するとともに、学習済み表現を保持する。

ABSTRACT

The architecture and the parameters of neural networks are often optimized independently, which requires costly retraining of the parameters whenever the architecture is modified. In this work we instead focus on growing the architecture without requiring costly retraining. We present a method that adds new neurons during training without impacting what is already learned, while improving the training dynamics. We achieve the latter by maximizing the gradients of the new weights and find the optimal initialization efficiently by means of the singular value decomposition (SVD). We call this technique Gradient Maximizing Growth (GradMax) and demonstrate its effectiveness in variety of vision tasks and architectures.

研究の動機と目的

  • ニューラルネットワークのアーキテクチャを変更する際の再訓練の非効率性に対処すること。
  • アーキテクチャの段階的拡大における訓練ダイナミクスを、即時の損失低減ではなく勾配の大きさに注目することで改善すること。
  • 新しいニューロンの初期化を閉形式で行い、勾配寄与を最大化する手法を開発すること。
  • 性能の低下を伴わず、大規模な初期モデルを必要とせずにアーキテクチャの拡大を可能にすること。
  • 既存のニューラルアーキテクチャ探索やプルーニング手法のスケーラブルで効率的な代替手段を提供すること。

提案手法

  • GradMaxは、フルバッチ勾配行列の上位-k左特異ベクトルを用いて、新しいニューロンを初期化する。
  • 新しいニューロンの重みを、勾配ノルムを最大化するように設定することで、成長前後でネットワーク出力が変化しないように保証する。
  • 初期化問題を、新しい重みに関する勾配ノルムを最大化する形で定式化し、SVDを用いて閉形式の解を得る。
  • このアプローチは訓練中に適用され、新しいニューロンが固定間隔または事前に定義されたスケジュールに従って追加される。
  • 初期化時にネットワーク出力が変化しないようにすることで、既存の表現を保持する。
  • 全結合層および畳み込み層の両方と互換性があり、幅の拡大や新しい層の追加をサポートする。

実験結果

リサーチクエスチョン

  • RQ1再訓練を必要とせず、ニューラルネットワークを成長させながら訓練ダイナミクスを改善できるか?
  • RQ2初期化時に勾配ノルムを最大化することで、収束が速くなるか?
  • RQ3SVDを用いて、新しいニューロンの最適初期化を閉形式で得られるか?
  • RQ4ランダム初期化や損失低減に基づく初期化戦略と比較して、GradMaxは訓練速度と一般化性能において優れているか?
  • RQ5提案手法は多様なアーキテクチャや視覚タスクに適用可能か?

主な発見

  • GradMaxは、ImageNet や CIFAR-10 を含む複数の視覚タスクで、成長後の再訓練を必要とせずに、より速い収束を達成する。
  • 成長前後でネットワークの出力分布が維持され、学習済み表現が保持される。
  • SVDに基づく初期化は、新しいニューロンの勾配ノルムを効果的に最大化し、訓練全体にわたりその効果が持続する。
  • 訓練開始時にフルバッチとミニバッチのSVD間の整合性が強く、ミニバッチ近似の妥当性が裏付けられる。
  • 特に初期訓練段階において、ランダムまたは損失低減に基づく初期化手法よりもGradMaxが優れた性能を示す。
  • このアプローチは、幅の拡大および深さの増加の両方で有効であり、広範なニューラルアーキテクチャ探索パイプラインに統合可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。