Skip to main content
QUICK REVIEW

[論文レビュー] Finite size corrections for neural network Gaussian processes

Joseph M. Antognini|arXiv (Cornell University)|Aug 27, 2019
Gaussian Processes and Bayesian Inference参考文献 24被引用数 17
ひとこと要約

本稿では、1つの隠れ層を持つ大規模で有限幅の全結合ニューラルネットワークについて、初期化時の出力分布がガウス過程に4次ヘルミート多項式による摂動を加えたものでよく近似されることを示している。摂動の大きさは隠れユニット数Nに反比例して変化し、無限幅ガウス過程極限に対する有限サイズ補正としてのエッジワース展開の有効性が裏付けられる。

ABSTRACT

There has been a recent surge of interest in modeling neural networks (NNs) as Gaussian processes. In the limit of a NN of infinite width the NN becomes equivalent to a Gaussian process. Here we demonstrate that for an ensemble of large, finite, fully connected networks with a single hidden layer the distribution of outputs at initialization is well described by a Gaussian perturbed by the fourth Hermite polynomial for weights drawn from a symmetric distribution. We show that the scale of the perturbation is inversely proportional to the number of units in the NN and that higher order terms decay more rapidly, thereby recovering the Edgeworth expansion. We conclude by observing that understanding how this perturbation changes under training would reveal the regimes in which the Gaussian process framework is valid to model NN behavior.

研究の動機と目的

  • 無限幅ニューラルネットワークのガウス過程と実用的で有限幅のネットワークとの間のギャップを埋めること。
  • 初期化時における有限幅ニューラルネットワークの出力分布におけるガウス性からのずれを定量化すること。
  • エッジワース展開がニューラルネットワークの出力における有限サイズ効果を正確に記述できるかどうかを検証すること。
  • 訓練過程における非ガウス的補正の安定性を評価し、ニューラルネットワークのダイナミクスをモデル化するガウス過程フレームワークの有効性に影響を与えること。

提案手法

  • 特徴関数解析を用いて、N個の隠れユニットを持つ1層隠れ層ニューラルネットワークの出力分布を導出する。
  • ガウス近似を超える高次モーメント(特に4次モーメント)をモデル化するためにエッジワース展開を適用する。
  • 出力分布におけるガウス分布への一次補正を、3次ヘルミート多項式を用いて記述する。
  • N=128のネットワークを10^8個サンプリングし、経験的累積分布関数(CDF)を予測された摂動付きガウス分布と比較することで、実証的妥当性を検証する。
  • N ∈ [8, 148] の範囲で摂動の大きさがN^−1に比例するかをフィッティングし、スケーリングを測定する。
  • 重みの初期化にガロアユーロの均一初期化(Glorot uniform)とReLU活性化関数を用い、全実験で一貫した有限分散初期化を確保する。

実験結果

リサーチクエスチョン

  • RQ1有限幅ニューラルネットワークの初期化時における出力分布は、ガウス過程からどの程度ずれるか?
  • RQ2有限幅ネットワークにおけるガウス近似への一次補正の関数的形は何か?
  • RQ3非ガウス的補正の大きさは隠れユニット数Nとどのようにスケーリングされるか?
  • RQ4訓練過程で摂動は安定しているか、あるいは顕著に変化するか?これはガウス過程フレームワークの有効性に何を示唆するか?
  • RQ5エッジワース展開は、大規模だが有限なニューラルネットワークの出力分布を正確に記述できるか?

主な発見

  • 初期化時の有限幅ニューラルネットワークの出力分布は、抽象では4次ヘルミート多項式による摂動と記述されているが、CDF比較により、実際には3次ヘルミート多項式による摂動が最も適切であると確認された。
  • 摂動の大きさは約N^−1.07に比例しており、ネットワーク幅に反比例する減衰を確認した。
  • N=128のネットワークを10^8個サンプリングした経験的CDFは、予測された摂動付きガウスモデルと極めて良好に一致した。
  • 一次補正は3次ヘルミート多項式が支配的であり、高次項はより速く減衰する。これはエッジワース展開の予測と整合的である。
  • 初期化条件下で摂動は安定しており、有限サイズ効果が体系的に定量可能であることが示唆され、訓練過程におけるガウス過程フレームワークの有効性に影響を与える。
  • 結果から、非ガウス的補正を有限サイズ補正として考慮すれば、ガウス過程が有限ネットワークに対して依然として強力な近似であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。