Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Neural Networks with Dynamic Regularization

Yi Wang, Zhen-Peng Bian|arXiv (Cornell University)|Sep 26, 2019
Advanced Neural Network Applications参考文献 29被引用数 5
ひとこと要約

この論文では、訓練損失の変化率に基づいて正則化強度を動的に調整する畳み込みニューラルネットワーク(CNN)のための動的正則化手法を提案する。損失の後退差分を用いて正則化を関数としてモデル化することで、大規模なモデルに対しては強い摂動を、小規模なモデルに対しては弱い摂動を自発的に提供する。この手法により汎化性能が向上し、画像分類ベンチマークにおいてShakeDrop や DropBlock といった最先端手法を上回る性能を発揮する。

ABSTRACT

Regularization is commonly used for alleviating overfitting in machine learning. For convolutional neural networks (CNNs), regularization methods, such as DropBlock and Shake-Shake, have illustrated the improvement in the generalization performance. However, these methods lack a self-adaptive ability throughout training. That is, the regularization strength is fixed to a predefined schedule, and manual adjustments are required to adapt to various network architectures. In this paper, we propose a dynamic regularization method for CNNs. Specifically, we model the regularization strength as a function of the training loss. According to the change of the training loss, our method can dynamically adjust the regularization strength in the training procedure, thereby balancing the underfitting and overfitting of CNNs. With dynamic regularization, a large-scale model is automatically regularized by the strong perturbation, and vice versa. Experimental results show that the proposed method can improve the generalization capability on off-the-shelf network architectures and outperform state-of-the-art regularization methods.

研究の動機と目的

  • 固定された正則化強度を用いる従来のCNN手法には、モデルサイズや訓練ダイナミクスに応じた適応性が欠けるという限界を是正すること。
  • 訓練中に正則化強度を動的に調整することで過学習を低減し、汎化性能を向上させること。
  • 訓練プロセスに自発的に適応する正則化を導入することで、手動によるハイパーパrameterチューニングを排除すること。
  • 訓練の進行に伴い正則化強度を増加させることで、過学習と不足学習のバランスを取ること。

提案手法

  • 正則化強度を訓練損失の後退差分の関数としてモデル化することで、訓練中にリアルタイムで適応可能にする。
  • 損失勾配に基づいて更新される動的要因が、残差ブランチに適用される特徴空間の摂動の振幅を制御する。
  • ランダムノイズを、レイヤー単位で構造的に特徴マップに適用し、ノイズの範囲を下位の残差ブロックから上位のブロックへ線形に増大させる。
  • ミニバッチのフラクチュエーションに起因するノイズを低減するため、動的要因の更新前に損失信号にガウスフィルタを適用する。
  • 残差ブロックを変更することで、学習可能な損失依存型摂動ゲートを含む、ResNetに類似したアーキテクチャに統合する。
  • 正則化は前方伝搬および逆伝搬の両方で適用され、特徴の拡張が実現され、耐性が向上する。

実験結果

リサーチクエスチョン

  • RQ1訓練中に正則化強度を動的に調整することで、手動チューニングなしに汎化性能を向上させられるか?
  • RQ2損失依存型の正則化スケジュールは、固定または線形スケジュールのものよりも、多様なネットワークアーキテクチャで優れた性能を発揮するか?
  • RQ3動的正則化は、深さや幅が異なるモデルの間で、過学習と不足学習のバランスを効果的に取れるか?
  • RQ4訓練損失への動的要因の適応は、静的またはスケジュールベースのアプローチと比較して、テスト精度において優れた性能を発揮するか?

主な発見

  • 提案手法の動的正則化は、PyramidNet-26-a84でTop-1誤差率23.83%を達成し、ベースライン(26.30%)およびすべての固定/線形スケジュールを上回った。
  • 訓練誤差とテスト誤差の一般化ギャップが縮小され、特にPyramidNet-110-a48のような深層モデルで顕著な縮小が観察された。
  • ノイズ範囲を線形に増大させる(R)ことで性能が向上し、誤差率を25.28%から23.83%に低下させた。
  • ガウスフィルタを削除すると誤差率が1.38%上昇し、動的要因の更新を安定化させる役割を果たしていることが確認された。
  • 最先端手法、たとえばShakeDrop、Shake-Shake、DropBlockと比較して、複数のアーキテクチャで優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。