Skip to main content
QUICK REVIEW

[論文レビュー] The Limitations of Large Width in Neural Networks: A Deep Gaussian Process Perspective

Geoff Pleiss, John P. Cunningham|arXiv (Cornell University)|Jun 11, 2021
Gaussian Processes and Bayesian Inference被引用数 8
ひとこと要約

この論文は、深層ガウス過程(Deep GP)というニューラルネットワークの非パrametric一般化を用いて、広いニューラルネットワークの帰納的バイアスを分析する。無限大の幅に達する極限でDeep GPが単層ガウス過程に収束することを証明し、階層的表現能力を失う。驚くべきことに、最適なテスト性能は幅1または2で達成され、十分な表現能力が得られた後でも、過剰な幅がモデルの適応性と性能を損なうことが示された。

ABSTRACT

Large width limits have been a recent focus of deep learning research: modulo computational practicalities, do wider networks outperform narrower ones? Answering this question has been challenging, as conventional networks gain representational power with width, potentially masking any negative effects. Our analysis in this paper decouples capacity and width via the generalization of neural networks to Deep Gaussian Processes (Deep GP), a class of nonparametric hierarchical models that subsume neural nets. In doing so, we aim to understand how width affects (standard) neural networks once they have sufficient capacity for a given modeling task. Our theoretical and empirical results on Deep GP suggest that large width can be detrimental to hierarchical models. Surprisingly, we prove that even nonparametric Deep GP converge to Gaussian processes, effectively becoming shallower without any increase in representational power. The posterior, which corresponds to a mixture of data-adaptable basis functions, becomes less data-dependent with width. Our tail analysis demonstrates that width and depth have opposite effects: depth accentuates a model's non-Gaussianity, while width makes models increasingly Gaussian. We find there is a "sweet spot" that maximizes test performance before the limiting GP behavior prevents adaptability, occurring at width = 1 or width = 2 for nonparametric Deep GP. These results make strong predictions about the same phenomenon in conventional neural networks trained with L2 regularization (analogous to a Gaussian prior on parameters): we show that such neural networks may need up to 500 - 1000 hidden units for sufficient capacity - depending on the dataset - but further width degrades performance.

研究の動機と目的

  • 標準的なニューラルネットワークをDeep GPに一般化し、各層をベクトル値ガウス過程とする。これにより、幅とは独立して表現能力を制御できる。
  • 十分な表現能力が得られた後でも、大きな幅がモデルの性能に良い影響を与えるかどうかを調査する。
  • 階層的モデルにおける幅がもたらす帰納的バイアスを分析し、特に幅が事後分布の適応性と非ガウス性に与える影響を明らかにする。
  • 表現能力が限界に達した後でも、幅が性能に悪影響を及えるかどうかを検証する。
  • Deep GPの知見を、パrameterにL2正則化を適用する従来のニューラルネットワークに拡張し、パラメータにガウス的事前分布が導入されることを考慮する。

提案手法

  • 標準的なニューラルネットワークを、各層がベクトル値ガウス過程であるDeep GPに一般化し、表現能力を幅とは独立して制御できるようにする。
  • 無限大の幅極限においてDeep GPが単層ガウス過程に収束することを証明する(定理1)。これにより、深さと階層的特徴抽出能力が失われる。
  • Deep GPの事後平均を再生核ヒルバート空間におけるデータ適応型基底関数の混合として分析し、幅が増加するにつれてデータ依存性が低下することを示す。
  • 尾部解析を実施し、幅と深さの影響を比較する。深さは非ガウス性を増加させる(尾が太くなり、ピークが鋭くなるが)、一方幅はガウス性を増加させる(定理2および定理3)。
  • MNISTおよびCIFAR10での実験を通じて理論的知見を検証する。ベイジアンおよび従来のニューラルネットワークをL2正則化で訓練し、極限のGPと同等のハイパーパrameterを設定する。
  • Deep GPとニューラルネットワークのハイパーパrameterを極限のGPに一致させる。これにより公平な比較が可能となる。ベイジアンモデルでは対数マージナル尤度の最大化とNUTSサンプリングを用いる。

実験結果

リサーチクエスチョン

  • RQ1十分な表現能力が得られた後でも、幅をさらに大きくすることで一般化性能が向上するのか、それとも表現の柔軟性の喪失により性能が低下するのか?
  • RQ2無限大の幅極限において、Deep GPの事後分布と帰納的バイアスはどのように変化するのか。これは、データへのモデルの適応性にどのような影響を及えるか?
  • RQ3幅と深さは、非ガウス性(特に尾の太さとピークの鋭さ)にどのように異なる影響を与えるのか?
  • RQ4非パラメトリックなDeep GPから得られる知見は、L2正則化を適用するパラメトリックなニューラルネットワークにどのように応用可能か。このようなモデルの最適な幅は何か?
  • RQ5モデルが浅いGP極限に収束する前に、テスト性能を最大化する「最適幅」が存在するのか?

主な発見

  • Deep GPは無限大の幅極限において単層ガウス過程に収束し、深さと階層的特徴抽出能力を失う(定理1)。
  • Deep GPの事後平均は、幅が増加するにつれてデータ依存性が低下し、データに依存しないカーネルに収束する。これは特徴抽出能力の低下を示唆する。
  • 幅と深さは逆の効果を持つ。深さは非ガウス性を増加させる(尾が太くなり、ピークが鋭くなるが)、一方幅はガウス性を増加させる(定理2および定理3)。
  • 非パラメトリックなDeep GPでは、最適なテスト性能が幅1または2で達成され、さらに幅を大きくすると性能が低下する。
  • L2正則化を適用するベイジアンおよび従来のニューラルネットワークでは、ある幅を超えると性能が低下し、小規模なデータセット(N ≤ 1000)では16ユニット以下が最適である。
  • CIFAR10のような大規模データセットでは、従来のニューラルネットワークの最適幅も制限されており、500〜1000ユニットを超えると性能が低下する。これはデータセットやアーキテクチャに依存する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。