[論文レビュー] Robustness in deep learning: The good (width), the bad (depth), and the ugly (initialization)
この論文は、摂動安定性という指標を用いて、深層ニューラルネットワークの平均的ロバストネスに、幅、深さ、重み初期化がどのように影響するかを調査している。幅は過パラメータ化された状態ではロバストネスを向上させるが、未パラメータ化された状態では逆に悪化させることが示され、深さの影響は初期化に強く依存する——ラムゼイ初期化ではラージトレーニングにおいてロバストネスを向上させるが、ヘーア初期化やNTK初期化ではロバストネスを低下させる。
We study the average robustness notion in deep neural networks in (selected) wide and narrow, deep and shallow, as well as lazy and non-lazy training settings. We prove that in the under-parameterized setting, width has a negative effect while it improves robustness in the over-parameterized setting. The effect of depth closely depends on the initialization and the training mode. In particular, when initialized with LeCun initialization, depth helps robustness with the lazy training regime. In contrast, when initialized with Neural Tangent Kernel (NTK) and He-initialization, depth hurts the robustness. Moreover, under the non-lazy training regime, we demonstrate how the width of a two-layer ReLU network benefits robustness. Our theoretical developments improve the results by [Huang et al. NeurIPS21; Wu et al. NeurIPS21] and are consistent with [Bubeck and Sellke NeurIPS21; Bubeck et al. COLT21].
研究の動機と目的
- 過パラメータ化が adversarial robustness を向上させるか悪化させるかという理論的矛盾を解消すること。
- 幅、深さ、初期化が深層ニューラルネットワークの平均的ロバストネスに与える役割を分析すること。
- ラージトレーニングと非ラージトレーニングの両方の訓練状態下で、摂動安定性の理論的上限を確立すること。
- 先行研究のロバストネスに関する結果を、過パラメータ化および未パラメータ化の両状態における幅・深さ・初期化の相乗効果を含める形に拡張すること。
- 全結合層、畳み込み層、ResNetアーキテクチャを用いた実験を通じて理論的予測を検証すること。
提案手法
- ℓ₂ノルムの半径εの球内での入力摂動に対するネットワーク出力の勾配ノルムの期待値として定義される、摂動安定性という指標を提案する。
- 異なる初期化法(ラムゼイ、ヘーア、NTK)と訓練状態(ラージ、非ラージ)における深層ReLUネットワークの摂動安定性に対する理論的上限を導出する。
- 漸近的解析を用いて、未パラメータ化および過パラメータ化状態下での幅と深さのロバストネスへの影響を分析する。
- 非ラージトレーニング状態下の2層ReLUネットワークに分析を適用し、先行研究を上回る境界を導出する。
- ニューラル接線カーネル(NTK)理論とランダム行列理論の技術を用いて、訓練中の勾配ノルムの挙動を特徴付ける。
- 全結合層、畳み込み層、ResNetアーキテクチャを用いた実験を通じて、理論的予測の妥当性を検証する。
実験結果
リサーチクエスチョン
- RQ1未パラメータ化と過パラメータ化の両状態において、ネットワークの幅は平均的ロバストネスにどのように影響するか?
- RQ2深さはロバストネスにどのように影響し、これは初期化法に依存するか?
- RQ3訓練状態(ラージ対非ラージ)が深層ネットワークのロバストネスに与える役割は何か?
- RQ4異なる初期化法(ラムゼイ、ヘーア、NTK)は、深層ネットワークの摂動安定性にどのように影響するか?
- RQ52層ネットワークを超えた非ラージトレーニング状態下でも、摂動安定性の理論的境界を拡張できるか?
主な発見
- 過パラメータ化状態では、幅を増やすことでロバストネスが向上するが、未パラメータ化状態では、幅が一時的にロバストネスを低下させた後、再び向上するという段階的転移が観察される。
- ラムゼイ初期化とラージトレーニング下では、深さが指数関数的にロバストネスを向上させる。境界は(√2/2)^{L−2}とスケーリングされる。
- ヘーア初期化およびNTK初期化下では、深さがロバストネスを多項式的に低下させる。境界はヘーア初期化では√(L³m/d)、NTK初期化では√(L³m/o)e^{−m/L³}と成長する。
- 非ラージトレーニング状態下では、2層ReLUネットワークにおいて幅がロバストネスを向上させる。理論的境界は Huang et al. (2021) や Wu et al. (2021) よりも改善されている。
- 全結合層、畳み込み層、ResNetアーキテクチャにおける実験結果は、理論的傾向を裏付ける。非ラージ状態では幅が増えるほどロバストネスが向上し、ヘーアおよびNTK初期化下では深さに応じてロバストネスの変動が顕著に現れる。
- 非ラージ状態では理論的境界がやや緩いため、2層を超える深層ネットワークの解析においてさらなる改善の余地がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。