Skip to main content
QUICK REVIEW

[論文レビュー] Richer priors for infinitely wide multi-layer perceptrons

Russell Tsuchida, Fred Roosta|arXiv (Cornell University)|Nov 29, 2019
Neural Networks and Applications参考文献 33被引用数 6
ひとこと要約

この論文は、無限に広い多層パーセプトロン(MLP)とガウス過程(GP)の古典的関係を、非ゼロ平均および部分的交換可能(RCE)のより豊かな事前分布を導入することで拡張する。このような事前分布は、ハイパーパrameterの階層的推論を伴うGP極限をもたらし、より表現力のあるカーネルを生成するが、深さが増すにつれて周辺尤度が著しく悪条件化する。

ABSTRACT

It is well-known that the distribution over functions induced through a zero-mean iid prior distribution over the parameters of a multi-layer perceptron (MLP) converges to a Gaussian process (GP), under mild conditions. We extend this result firstly to independent priors with general zero or non-zero means, and secondly to a family of partially exchangeable priors which generalise iid priors. We discuss how the second prior arises naturally when considering an equivalence class of functions in an MLP and through training processes such as stochastic gradient descent. The model resulting from partially exchangeable priors is a GP, with an additional level of inference in the sense that the prior and posterior predictive distributions require marginalisation over hyperparameters. We derive the kernels of the limiting GP in deep MLPs, and show empirically that these kernels avoid certain pathologies present in previously studied priors. We empirically evaluate our claims of convergence by measuring the maximum mean discrepancy between finite width models and limiting models. We compare the performance of our new limiting model to some previously discussed models on synthetic regression problems. We observe increasing ill-conditioning of the marginal likelihood and hyper-posterior as the depth of the model increases, drawing parallels with finite width networks which require notoriously involved optimisation tricks.

研究の動機と目的

  • 無限に広いMLPにおけるi.i.d.ゼロ平均重みがGPに収束するという古典的結果を、非ゼロ平均事前分布を許容することで一般化すること。
  • MLPにおける置換対称性およびSGDトレーニングダイナミクスから自然に生じる部分的交換可能事前分布(RCE)を導入すること。
  • これらのより豊かな事前分布の下で深層MLPの極限GPカーネルを導出し、その性質を分析すること。
  • 有限幅モデルから極限GPへの収束を実験的に評価し、合成回帰タスクでの性能を検証すること。
  • 新しい事前構造下での周辺尤度およびハイパーポストリアーの悪条件化の挙動を調査すること。

提案手法

  • 中心極限定理および関数的中心極限定理を用いて、一般のゼロ平均または非ゼロ平均i.i.d.事前分布の下で深層MLPの極限GPカーネルを導出する。
  • 層内に依存性を許容しつつも対称性を保つ部分的交換可能事前分布(RCE)を導入し、i.i.d.事前分布を一般化する。
  • 結果として得られるモデルが、ハイパーパrameterの周辺化(レベルII推論)を必要とする階層的事前分布を持つGPであることを示す。
  • 非ゼロ平均を伴うReLUおよびLeaky ReLU活性化関数の下でのカーネルの明示的表現を導出する。
  • 有限幅モデルから極限GPへの収束を測定するために、最大平均差分(MMD)を用いる。
  • 平均および分散に非情報的ハイパーパラメータを設定した2変量正規分布を提案分布とするメトロポリス・ハスティングスサンプラーを用いて、ハイパーポストリアーと周辺尤度を探索する。

実験結果

リサーチクエスチョン

  • RQ1事前分布における非ゼロ平均を許容することで、深層MLPにおける極限GPカーネルにどのような影響が生じるか?
  • RQ2MLPの対称性およびSGDトレーニングダイナミクスから部分的交換可能事前分布(RCE)を導出可能か?また、i.i.d.事前分布をどのように一般化するか?
  • RQ3非ゼロ平均およびRCE事前分布下での極限GPカーネルの構造的および機能的性質は何か?標準的なi.i.d.事前分布と比較してどう異なるか?
  • RQ4新しい事前構造下で、深層モデルにおける周辺尤度およびハイパーポストリアーはどのように振る舞うか?深さが増すと悪条件化が生じるか?
  • RQ5新しいカーネル構造は、標準的なGP事前分布と比較して、合成回帰タスクにおける一般化性能の向上をもたらすか?

主な発見

  • 非ゼロ平均事前分布下での極限GPは、特に深層ネットワークにおいて、標準的なゼロ平均ケースと比較してより表現力のあるカーネル構造を示す。
  • RCE事前分布は、MLPにおける置換対称性およびSGDトレーニングダイナミクスから自然に生じる。
  • 結果として得られるモデルは、ハイパーパrameterの周辺化を必要とする階層的推論を伴うGPである。
  • 実験的評価により、有限幅モデルと極限GPとの間のMMDは、幅が増すにつれて減少し、収束が確認された。
  • 周辺尤度およびハイパーポストリアーは、深さが増すにつれて著しく悪条件化する傾向を示し、有限幅ネットワーク最適化における課題と類似する。
  • 非ゼロ平均を有するモデルは、特に深層アーキテクチャにおいて過学習にさらされやすくなることが示され、表現力と一般化性能のトレードオフが生じることを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。