Skip to main content
QUICK REVIEW

[论文解读] Information in Infinite Ensembles of Infinitely-Wide Neural Networks

Ravid Shwartz-Ziv, Alexander A. Alemi|arXiv (Cornell University)|Nov 20, 2019
Neural Networks and Applications参考文献 16被引用 8
一句话总结

本文通过可处理的信息论分析,研究了无限宽度神经网络的无限集合中的泛化问题。结果表明,尽管参数与数据之间的互信息发散(导致PAC-Bayes界变得无意义),但诸如表示-输入和表示-目标之间的互信息等关键量仍保持有限且可分析,揭示了集合平均压缩了输入信息,并在信息平面中实现了最优权衡。

ABSTRACT

In this preliminary work, we study the generalization properties of infinite ensembles of infinitely-wide neural networks. Amazingly, this model family admits tractable calculations for many information-theoretic quantities. We report analytical and empirical investigations in the search for signals that correlate with generalization.

研究动机与目标

  • 通过信息论视角理解无限宽神经网络中的泛化行为。
  • 研究在无限集合中,是否可处理的信息论量可反映泛化性能。
  • 分析在无限宽度极限下,表示、输入、目标与参数之间互信息的行为。
  • 评估PAC-Bayes风格泛化界在此情形下的有效性。
  • 探索梯度流下参数轨迹的信息几何结构。

提出的方法

  • 建模通过平方损失进行梯度流训练的无限宽度神经网络的无限集合。
  • 使用神经正切核(NTK)形式化描述网络动态,使输出分布可表示为条件高斯分布并实现闭式计算。
  • 推导出互信息量的解析表达式:I(Z;Y)、I(Z;X|D)、I(Z;D|X) 和 I(Θ;D)。
  • 采用变分界和变量变换公式,估算参数与数据之间的互信息。
  • 利用NTK和初始权重协方差,计算参数空间中的费舍尔信息度量和参数轨迹长度。
  • 采用高斯过程与线性代数技术,计算对随机初始化的期望值。

实验结果

研究问题

  • RQ1在无限宽度网络的无限集合中,信息论量(如互信息)能否实现解析计算?
  • RQ2这些量是否与无限宽度极限下的泛化性能相关?
  • RQ3为何尽管泛化性能良好,PAC-Bayes界在此情形下仍会失效?
  • RQ4与单个网络相比,集合平均如何压缩输入信息?
  • RQ5参数轨迹长度与参数空间中的信息几何行为如何?

主要发现

  • 即使训练时间趋于无穷,网络输出与输入之间的互信息 I(Z;X|D) 仍保持有限且较小,表明集合有效压缩了输入信息。
  • 表示与目标之间的互信息 I(Z;Y) 在高斯数据上接近最优性能,趋近于理论信息瓶颈边界。
  • 参数与数据之间的互信息 I(Θ;D) 随训练时间增加而发散,导致标准PAC-Bayes泛化界变得无意义。
  • 费舍尔信息度量在参数空间中为常数且平坦,尽管训练时间无限,参数轨迹长度仍为有限值。
  • 集合的输出分布为条件高斯分布,使所有关键信息论量均可实现闭式计算。
  • 对于ReLU和Erf网络,在初始权重方差较小时观察到过拟合,且Erf非线性导致测试损失的发散更严重。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。