[論文レビュー] Over-parametrized deep neural networks do not generalize well
この論文は、シグモイド活性化関数を備えた過剰にパラメータ化された深層ニューラルネットワークが、非パラメトリック回帰において、すらゼロの訓練誤差を達成しても、一般化がうまくいかないことを示している。最小二乗誤差を最小化するネットワークが、滑らかな回帰関数の最適ミニマックス収束率に到達しないことを示す下界を確立し、過剰にパラメータ化すれば一般化性能が良くなるという仮定に疑問を呈している。
Recently it was shown in several papers that backpropagation is able to find the global minimum of the empirical risk on the training data using over-parametrized deep neural networks. In this paper a similar result is shown for deep neural networks with the sigmoidal squasher activation function in a regression setting, and a lower bound is presented which proves that these networks do not generalize well on a new data in the sense that they do not achieve the optimal minimax rate of convergence for estimation of smooth regression functions.
研究の動機と目的
- 過剰にパラメータ化されたシグモイド活性化関数を備えた深層ニューラルネットワークが、非パラメトリック回帰において最適な一般化性能を達成できるかどうかを調査すること。
- 過剰にパラメータ化された状況下での最小二乗ニューラルネットワーク推定値の一般化誤差を分析すること。
- このようなネットワークの収束速度に対する理論的下界を確立し、それがミニマックス最適レートに到達しないことを示すこと。
- 訓練誤差を最小化しても一般化性能が良くなるという一般的な仮定に反論すること。
提案手法
- 回帰関数が滑らかで、誤差が有界であるランダム設計の回帰フレームワークを用いる。
- L層の隠れ層とシグモイドスケーラー活性化関数を備えたニューラルネットワークアーキテクチャを定義し、重みは最小二乗最小化により学習する。
- n個の異なる入力点を備えた特定のデータ分布を構築し、各点の確率は等しく1/nであり、i.i.d.な対称ノイズ(±1)を仮定する。
- 観測された入力点における経験的平均を用いる近傍型推定子 $\bar{m}_n$ をベンチマークとして定義する。
- ニューラルネットワーク推定値を $\bar{m}_n$ と関連づけ、濃度不等式を用いて期待 $L_2$ リスクの下界を導出する。
- 各入力点が観測される回数が二項分布に従うという事実を活用し、逆占有度数の期待値を用いて下界を導出する。
実験結果
リサーチクエスチョン
- RQ1過剰にパラメータ化されたシグモイド活性化関数を備えた深層ニューラルネットワークは、非パラメトリック回帰において最適ミニマックス収束率に到達できるか?
- RQ2バックプロパゲーションが訓練誤差を最小化できることから、このようなネットワークの一般化性能が良いと結論づけられるか?
- RQ3過剰にパラメータ化された状況下での最小二乗ニューラルネットワーク推定値の一般化誤差に対する根本的な下界は何か?
- RQ4期待 $L_2$ リスクの観点から、ニューラルネットワーク推定値の性能は単純な経験的平均推定子と比べてどうか?
- RQ5訓練データを完璧に適合させても、過剰にパラメータ化されたネットワークの一般化性能に理論的限界があるか?
主な発見
- 過剰にパラメータ化されたシグモイド活性化関数を備えた深層ニューラルネットワークは、滑らかな回帰関数の最適ミニマックス収束率に到達できず、一般化がうまくいかない。
- ニューラルネットワーク推定値の期待 $L_2$ リスクは、nが増加しても消えない正の定数で下から抑えられており、一般化が悪いことを示している。
- 下界は、ニューラルネットワーク推定値をベンチマークの経験的平均推定子 $\bar{m}_n$ と比較することで導出され、ネットワークの誤差が著しく小さくならないことが示された。
- ネットワークが訓練データを完璧に適合させても(訓練誤差がゼロであっても)、入力分布とノイズの構造のおかげで一般化誤差はゼロから離れたまま残る。
- 下界は、$n \geq 10$ に対して少なくとも $\frac{10}{11} \left(1 - \frac{21}{10e}\right)$ に達することが定量的に示され、これはゼロから離れているため、非最適性が証明された。
- ネットワークが過剰にパラメータ化されており、訓練データを補間できるにもかかわらず、この結果は、補間が一般化性能を保証しないことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。