Skip to main content
QUICK REVIEW

[論文レビュー] Wide Neural Networks with Bottlenecks are Deep Gaussian Processes

Devanshu Agrawal, Theodore Papamarkou|arXiv (Cornell University)|Jan 3, 2020
Gaussian Processes and Bayesian Inference参考文献 55被引用数 6
ひとこと要約

この論文は、有限幅のボトルネック層を備えたベイジアンニューラルネットワーク(BNN)が、広大な極限においてガウス過程の合成に収束することを証明している—これをボトルネックニューラルネットワークガウス過程(bottleneck NNGP)と呼ぶ。主な貢献は、階層的構造の収束において、極限と合成の操作を入れ替えるという微妙な技術的課題を形式的に解消したことである。

ABSTRACT

There has recently been much work on the "wide limit" of neural networks, where Bayesian neural networks (BNNs) are shown to converge to a Gaussian process (GP) as all hidden layers are sent to infinite width. However, these results do not apply to architectures that require one or more of the hidden layers to remain narrow. In this paper, we consider the wide limit of BNNs where some hidden layers, called "bottlenecks", are held at finite width. The result is a composition of GPs that we term a "bottleneck neural network Gaussian process" (bottleneck NNGP). Although intuitive, the subtlety of the proof is in showing that the wide limit of a composition of networks is in fact the composition of the limiting GPs. We also analyze theoretically a single-bottleneck NNGP, finding that the bottleneck induces dependence between the outputs of a multi-output network that persists through extreme post-bottleneck depths, and prevents the kernel of the network from losing discriminative power at extreme post-bottleneck depths.

研究の動機と目的

  • 有限幅のボトルネック層を有するベイジアンニューラルネットワークが広大な極限において深層ガウス過程に収束することを形式的に確立すること。
  • 階層的ニューラルネットワークアーキテクチャにおける、極限と合成の操作の交換という技術的課題を解決すること。
  • ボトルネック構造がNNGPの理論的枠組みとDGPの理論的枠組みを統合することを示し、NNGPの合成を生み出すことを通じて、その統合を実現すること。
  • マルチアウトプットネットワークにおける出力依存性とカーネル挙動にボトルネック層が与える影響を分析すること。
  • 実データセット上で、ボトルネック付きNNGPが標準NNGPよりも高いモデル尤度を達成することを実証的に示すこと。

提案手法

  • 有限幅の1つ以上の隠れ層を有するボトルネックBNNアーキテクチャを提案し、他のすべての層を無限大に拡大する。
  • 「コンポonent」を、入力層、ボトルネック層、または出力層の間のサブネットワークとして定義し、それぞれが広大な極限においてNNGPに収束することを示す。
  • 各ボトルネック後のコンポonentが入力に関して一様収束する限り、全体の合成の広大な極限が、制限されたNNGPの合成に収束することを確立する。
  • ボトルネック層の確率的プレアクティベーションの積分と極限の交換を正当化するために、有界収束定理を用いる。
  • 単一ボトルネック、マルチアウトプットReLUネットワークにおける出力二乗間の相関の閉形式表現を用いて、ボトルネックが引き起こす依存性を分析する。
  • カーネル伝播写像の固定点解析を用いて、ボトルネック後の深層極限におけるカーネルの漸近的挙動を導出する。

実験結果

リサーチクエスチョン

  • RQ1有限幅のボトルネック層を有するベイジアンニューラルネットワークの広大な極限が、ガウス過程の合成に収束するか?
  • RQ2合成ネットワークの極限を、そのコンポonentの極限の合成に等置できるか? その条件は何か?
  • RQ3ボトルネック層はマルチアウトプットの深層ネットワークにおける出力間の依存構造にどのように影響するか?
  • RQ4ボトルネック後の深層極限におけるカーネルの挙動は何か? また、その判別力は保持されるか?
  • RQ5ボトルネック付きNNGPは、実データセット上で標準NNGPよりも高いモデル尤度を達成できるか?

主な発見

  • ボトルネック層を有するベイジアンニューラルネットワークの広大な極限は、NNGPの合成からなる深層ガウス過程に収束する。これは直感的な期待を形式的に証明した。
  • ボトルネック後のコンポonentが入力に関して一様収束する限り、合成ネットワークの収束が制限されたGPsの合成に一致することが保証される。
  • 単一のボトルネック層ですら、マルチアウトプットネットワークにおける出力変数間に非自明な依存性を誘発する。これは深層ボトルネック後の極限においても成立する。
  • ReLUベースのボトルネックNNGPにおける出力二乗間の相関は、カーネル伝播写像の固定点を含む閉形式式で与えられる。
  • ボトルネック後の深層極限において、カーネルは非退化であり、判別力を持つ。特に、ボトルネック後の重み分散が1を超える場合、出力間の相関は1から離れている。
  • 実証的結果により、ボトルネック付きNNGPが3つのベンチマークデータセットで標準NNGPよりも高いモデル尤度を達成することが示された。これにより、このアーキテクチャの実用的利点が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。