Skip to main content
QUICK REVIEW

[论文解读] Exact marginal prior distributions of finite Bayesian neural networks

Jacob A. Zavatone-Veth, Cengiz Pehlevan|arXiv (Cornell University)|Apr 23, 2021
Gaussian Processes and Bayesian Inference参考文献 40被引用 10
一句话总结

本文推导了有限贝叶斯神经网络的精确边缘先验分布,表明深度线性网络的先验可通过梅杰尔G函数表达,而ReLU网络则产生对应于激活ReLU单元的线性网络先验的混合分布。精确解揭示了有限宽度网络中的重尾行为,与假设次高斯尾部的微扰近似相矛盾。

ABSTRACT

Bayesian neural networks are theoretically well-understood only in the infinite-width limit, where Gaussian priors over network weights yield Gaussian priors over network outputs. Recent work has suggested that finite Bayesian networks may outperform their infinite counterparts, but their non-Gaussian function space priors have been characterized only though perturbative approaches. Here, we derive exact solutions for the function space priors for individual input examples of a class of finite fully-connected feedforward Bayesian neural networks. For deep linear networks, the prior has a simple expression in terms of the Meijer $G$-function. The prior of a finite ReLU network is a mixture of the priors of linear networks of smaller widths, corresponding to different numbers of active units in each layer. Our results unify previous descriptions of finite network priors in terms of their tail decay and large-width behavior.

研究动机与目标

  • 为理解有限宽度贝叶斯神经网络在函数空间中的先验分布,弥合理论上的空白。
  • 推导网络输出边缘先验的精确表达式,重点关注单个输入样本。
  • 刻画有限网络先验的非高斯、重尾特性,尤其在深度和窄架构中。
  • 表明微扰修正无法捕捉有限宽度先验的真实重尾行为。
  • 通过精确解统一先前关于尾部衰减和大宽度渐近行为的描述。

提出的方法

  • 推导具有各向同性高斯权重先验的全连接前馈贝叶斯神经网络中预激活的精确边缘先验分布。
  • 使用递归条件化和矩生成函数,将线性网络的先验表示为梅杰尔G函数。
  • 对于ReLU网络,将先验建模为所有可能激活模式的混合,权重由隐藏层中激活ReLU单元的二项概率决定。
  • 应用精确的矩计算和渐近展开,分析尾部分布行为和大宽度极限。
  • 通过蒙特卡洛采样和高精度数值计算(使用可变精度算术及截断以提高计算效率)验证结果。
  • 对小于 eps = 2^-52 的小二项系数设置截断,以在不损失精度的前提下加速ReLU网络先验的计算。

实验结果

研究问题

  • RQ1有限贝叶斯神经网络中输出预激活的边缘先验的确切形式是什么?
  • RQ2有限网络先验的尾部特性与微扰展开所预测的有何不同?
  • RQ3有限宽度下深度线性网络的先验函数形式是什么?
  • RQ4ReLU网络的先验如何在隐藏层的不同激活模式间分解?
  • RQ5精确解能否统一有限BNN中关于尾部衰减和大宽度渐近行为的先验描述?

主要发现

  • 深度线性贝叶斯神经网络的先验可精确表示为梅杰尔G函数,为有限宽度提供了闭式解。
  • ReLU网络的先验是较窄线性网络先验的混合,权重由隐藏层中每种激活模式的概率决定。
  • 有限宽度网络表现出重尾先验,且随着深度增加和宽度减小而更加显著,与微扰方法假设的次高斯尾部相矛盾。
  • 对无限宽度极限的微扰修正无法捕捉精确先真相实的重尾特性,表明此类近似存在根本性局限。
  • 精确解作为推论恢复了已知的渐近行为(如尾部衰减和大宽度极限),统一了先前结果。
  • 数值验证确认了在浮点精度截断下先验近似具有单调收敛性,深度宽网络的计算时间可达153小时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。