[論文レビュー] Gaussian Process Behaviour in Wide Deep Neural Networks
本論文は、複数の隠れ層を持つ深くて幅広い全結合ニューラルネットワークが、幅が増加するにつれて緩やかな条件の下で分布収束して Gaussian process に収束することを示し、Gaussian process の類似モデルおよび厳密なベイズニューラルネットワークに対する MMD との経験的検証を行う。
Whilst deep neural networks have shown great empirical success, there is still much work to be done to understand their theoretical properties. In this paper, we study the relationship between random, wide, fully connected, feedforward networks with more than one hidden layer and Gaussian processes with a recursive kernel definition. We show that, under broad conditions, as we make the architecture increasingly wide, the implied random function converges in distribution to a Gaussian process, formalising and extending existing results by Neal (1996) to deep networks. To evaluate convergence rates empirically, we use maximum mean discrepancy. We then compare finite Bayesian deep networks from the literature to Gaussian processes in terms of the key predictive quantities of interest, finding that in some cases the agreement can be very close. We discuss the desirability of Gaussian process behaviour and review non-Gaussian alternative models from the literature.
研究の動機と目的
- 複数の隠れ層を持つランダムな全結合ネットワークの理論的理解を拡張する。
- 広い幅の深層ネットワークが広範な条件下で Gaussian processes へ収束することを証明する。
- 最大平均差異 (MMD) を用いて収束速度を経験的に評価する。
- 予測量において有限の Bayesian deep networks を Gaussian processes と比較する。
- ベイズ深層学習および初期化/ダイナミクスへの影響について論じる。
提案手法
- 重みとバイアスに標準的なランダム正規事前分布を持つ D 隠れ層をもつ全結合ネットワークを定義する。
- 分散の爆発を避けるため、Neal (1996) に従って幅に応じて重みの分散をスケールする。
- 多変量中心極限定理を用いて層の活性化の結合分布が多変量正規分布へ収束することを示し、極限で Gaussian process を誘導する(Theorem 4)。
- 非線形性 φ に対して線形エンベロープ性を課す(|φ(u)| ≤ c + m|u|)。
- 再帰レマ(Lemma 2)を用いて層間の極限共分散構造を特徴づける。
- 有限ネットワークと GP analogues との間の最大平均差異 (MMD) によって GP への収束を測定する。
実験結果
リサーチクエスチョン
- RQ1深さがあり幅が広いニューラルネットワークが幅が増加するにつれて分布収束して Gaussian process へ収束する条件は何か?
- RQ2幅の成長の選択(層ごとに増加する場合)が GP への収束にどう影響するか?
- RQ3深さと幅の観点から Gaussian process への収束速度はどのくらいか?
- RQ4一般的なデータセットと事前分布に対して、有限の Bayesian deep networks は GP の予測とどれくらい一致するか?
主な発見
- 厳密な結果(Theorem 4)は、層数を固定した任意の場合に、幅関数が厳密に単調増加する限り Gaussian process への収束を示している。
- 極限 GP は平均ゼロで、共分散は再帰によって決定される(Lemma 2)。
- 経験的な MMD 実験では、幅が増すにつれて有限ネットワークが GP analogues にますます似てくるが、深いネットワークほど収束が遅い。
- 6 データセットのうち、5 つは exact GP 推論とMCMC を用いた有限 Bayesian neural networks の間で高い一致を示す。
- 異なる幅の成長スキーム(identity、largest last、largest first)でも、幅が増すにつれて GP 収束を導くことが確認され、定理の下で特定の幅関数の形状には依存しないことが示される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。