Skip to main content
QUICK REVIEW

[論文レビュー] Precise characterization of the prior predictive distribution of deep ReLU networks

Lorenzo Noci, Gregor Bachmann|arXiv (Cornell University)|Jun 11, 2021
Gaussian Processes and Bayesian Inference被引用数 7
ひとこと要約

本稿では、Meijer-G関数を用いて有限幅の深層ReLUネットワークにおける事前予測分布の正確な解析的特徴付けを提供し、深さが重たい尾部の性質を強化する一方で、幅がガウス分布に近づけることを明らかにした。無限深さ極限への正式な接続を確立し、正規-対数正規混合分布への収束を示し、予測分散を直接制御可能な深さおよび幅に依存する一般化されたHe事前分布を導入した。

ABSTRACT

Recent works on Bayesian neural networks (BNNs) have highlighted the need to better understand the implications of using Gaussian priors in combination with the compositional structure of the network architecture. Similar in spirit to the kind of analysis that has been developed to devise better initialization schemes for neural networks (cf. He- or Xavier initialization), we derive a precise characterization of the prior predictive distribution of finite-width ReLU networks with Gaussian weights. While theoretical results have been obtained for their heavy-tailedness, the full characterization of the prior predictive distribution (i.e. its density, CDF and moments), remained unknown prior to this work. Our analysis, based on the Meijer-G function, allows us to quantify the influence of architectural choices such as the width or depth of the network on the resulting shape of the prior predictive distribution. We also formally connect our results to previous work in the infinite width setting, demonstrating that the moments of the distribution converge to those of a normal log-normal mixture in the infinite depth limit. Finally, our results provide valuable guidance on prior design: for instance, controlling the predictive variance with depth- and width-informed priors on the weights of the network.

研究の動機と目的

  • 有限幅の深層ReLUネットワークにおける事前予測分布の分布的性質を理解すること。これは、既知の重たい尾部の挙動にもかかわらず、依然として十分に特徴づけられていない。
  • 特に深さと幅といったアーキテクチャのハイパーパrameterが、事前予測分布の形状に与える影響を形式化すること。
  • 無限幅極限の分析を無限深さの領域へ拡張し、ニューラルネットワークガウス過程に関する先行研究の結果を回復および一般化すること。
  • 関数空間における分散に配慮した解釈可能な事前分布の設計のための原理的枠組みを提供すること。例えば、一般化されたHe事前分布を含む。

提案手法

  • 著者らは、任意の深さと有限幅の深層ReLUネットワークにおける事前予測分布の確率密度関数を解析的に特徴付けるためにMeijer-G関数を用いた。
  • Gamma関数と二項係数を含むモーメント生成関数と組み合わせ的恒等式を用いて、事前予測分布のモーメントの正確な表現を導出した。
  • この分析は、ReLU非線形性を伴う確率的重み行列の積の構造を活用し、中間層活性化の和への問題の還元を可能にした。
  • 無限深さ極限は、モーメント生成関数の漸近的挙動を分析することで研究され、正規-対数正規混合分布への収束を示した。
  • この手法により、深さおよび幅に依存する重み分散を指定することで、予測分散を直接制御可能な一般化されたHe事前分布の導出が可能になった。

実験結果

リサーチクエスチョン

  • RQ1有限幅の深層ReLUネットワークにおける事前予測分布は、その深さと幅にどのように依存するか?
  • RQ2このようなネットワークにおける事前予測密度関数、累積分布関数、およびモーメントの正確な解析的形は何か?
  • RQ3無限深さ極限において、事前予測分布のモーメントはどのように振る舞い、どの分布に収束するか?
  • RQ4関数空間における予測分散を、層ごとのチューニングに依存せずに直接制御できる重み事前分布を設計できるか?

主な発見

  • 深層ReLUネットワークの事前予測分布はMeijer-G関数を用いて正確に特徴づけられ、密度関数、CDF、モーメントの完全な解析的記述が可能になった。
  • より深いネットワークは重たい尾部の性質を強化するが、より広いネットワークはガウス分布に近づける性質を示し、尾部挙動に対しては深さの影響がより顕著である。
  • 無限深さ極限において、事前予測分布のモーメントは正規-対数正規混合分布のモーメントに収束し、非漸近的領域でも実験的観察と一致した。
  • 深さが幅に線形に比例する場合(l−1 = γm)、偶数次のモーメントは(2k−1)!!·exp(5γk(k−1)/2)に収束し、対数正規成分の出現を確認した。
  • 本稿では、予測分散を直接指定可能な一般化されたHe事前分布を導入し、層ごとの分散チューニングよりも解釈性の高い代替手段を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。