Skip to main content
QUICK REVIEW

[論文レビュー] Regularizing Neural Networks via Adversarial Model Perturbation

Yaowei Zheng, Richong Zhang|arXiv (Cornell University)|Oct 10, 2020
Advanced Neural Network Applications参考文献 54被引用数 7
ひとこと要約

本稿では、モデルパラメータのノルム束縛された摂動内の最悪ケースの経験的リスクから導出される「AMP損失」を最小化することで、深層ニューラルネットワークの一般化性能を向上させる、新しい正則化手法である敵対的モデル摂動(AMP)を提案する。この手法は理論的に平坦な極小値を好む——一般化性能に良いとされるものであり、複数の画像分類ベンチマークで、MixUp や Flooding を含む既存の正則化手法を上回る最先端の性能を達成する。

ABSTRACT

Effective regularization techniques are highly desired in deep learning for alleviating overfitting and improving generalization. This work proposes a new regularization scheme, based on the understanding that the flat local minima of the empirical risk cause the model to generalize better. This scheme is referred to as adversarial model perturbation (AMP), where instead of directly minimizing the empirical risk, an alternative "AMP loss" is minimized via SGD. Specifically, the AMP loss is obtained from the empirical risk by applying the "worst" norm-bounded perturbation on each point in the parameter space. Comparing with most existing regularization schemes, AMP has strong theoretical justifications, in that minimizing the AMP loss can be shown theoretically to favour flat local minima of the empirical risk. Extensive experiments on various modern deep architectures establish AMP as a new state of the art among regularization schemes. Our code is available at https://github.com/hiyouga/AMP-Regularizer.

研究の動機と目的

  • 経験的リスクの平坦な局所的極小値を標的とすることで、深層ニューラルネットワークにおける一般化性能を向上させる原理的正則化スキームの開発。
  • MixUp やラベルスムージングなどの既存のヒューリスティックな正則化手法に強い理論的裏付けが欠けている問題に対処する。
  • パラメータ空間における敵対的摂動が、鋭い極小値を暗黙的にペナルティ化し、より平坦で一般化性能の高い解を促進するかどうかを調査する。
  • 標準的な画像分類ベンチマークにおいて、AMP の性能を最先端の正則化技術と比較する。
  • 摂動の大きさがモデルの一般化およびキャリブレーションに与える影響を分析し、計算コストを評価する。

提案手法

  • AMP損失を、半径 ε の ℓ2 ボール内におけるすべてのパラメータ摂動における経験的リスクの最大値として定義する:ℒ_AMP(θ) = max_{||Δ||≤ε} ℒ_ERM(θ + Δ)。
  • ミニバッチの確率的勾配降下法を用いて AMP 損失を最小化することで、パラメータ空間における小さな敵対的摂動に対してロバストなモデルの学習を実現する。
  • AMP 損失の最小化が、勾配ノルムに対する追加ペナルティを伴う正則化された経験的リスク最小化と同等であることを示し、代替的な理論的解釈を提供する。
  • 計算コストと効果のバランスを考慮し、敵対的摂動を計算する際に内側最適化ステップを1回(N=1)に制限した AMP 学習手順を実装する。
  • パラメータ空間における最大プーリングのアナロジーを活用する:AMP 損失は経験的リスクのランドスケープを「最悪ケース」の平滑化として機能し、より平坦な領域を好む。
  • 局所的極小値の「最も細い幅」を平坦さの指標として用い、AMP 最小化が暗黙的に狭い極小値をペナルティ化することを示す。

実験結果

リサーチクエスチョン

  • RQ1パラメータ空間におけるモデルパラメータの敵対的摂動は、平坦な極小値を生成し、一般化性能を向上させることができるか?
  • RQ2AMP 正則化スキームは、MixUp や Flooding などの既存のデータ依存型正則化手法と比較して、テスト精度およびキャリブレーションにおいてどのように異なるか?
  • RQ3最良の一般化性能を得るための最適な摂動半径 ε は何か?
  • RQ4期待キャリブレーション誤差(ECE)で測定した場合、AMP はモデルのキャリブレーションを向上させるか?
  • RQ5AMP の計算コストは、標準的な ERM 学習と比較してどの程度か?性能を損なわず、効率化可能か?

主な発見

  • AMP は SVHN、CIFAR-10、CIFAR-100 で、ERM、MixUp、Flooding、ラベルスムージングを上回る最先端のテスト精度を達成する。
  • CIFAR-10 では、AMP が期待キャリブレーション誤差(ECE)を 2.1% まで低減させ、他の手法と比較して優れたキャリブレーション性能を示す。
  • 最適な摂動半径 ε ≈ 0.06 が最低のテスト誤差をもたらし、平坦さと極小値の深さの間のトレードオフを示している。
  • N=1 の内側イテレーションを用いた AMP 学習では、標準的な ERM 学習と比較して学習時間がたった 1.8 倍に増加するため、計算的に実用的である。
  • AMP 損失のランドスケープから、右側の平坦な極小値が左側の鋭い極小値よりも低いことが確認され、AMP が平坦な極小値を好むことが裏付けられた。
  • AMP は、局所的極小値の「最も細い幅」が暗黙的に最小化されることから、より広い盆地を持つ極小値を選択することで、一般化性能を向上させている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。