QUICK REVIEW
[论文解读] Information in Infinite Ensembles of Infinitely-Wide Neural Networks
Ravid Shwartz-Ziv, Alexander A. Alemi|arXiv (Cornell University)|Nov 20, 2019
Neural Networks and Applications参考文献 16被引用 8
一句话总结
本文通过可处理的信息论分析,研究了无限宽度神经网络的无限集合中的泛化问题。结果表明,尽管参数与数据之间的互信息发散(导致PAC-Bayes界变得无意义),但诸如表示-输入和表示-目标之间的互信息等关键量仍保持有限且可分析,揭示了集合平均压缩了输入信息,并在信息平面中实现了最优权衡。
ABSTRACT
In this preliminary work, we study the generalization properties of infinite ensembles of infinitely-wide neural networks. Amazingly, this model family admits tractable calculations for many information-theoretic quantities. We report analytical and empirical investigations in the search for signals that correlate with generalization.
研究动机与目标
- 通过信息论视角理解无限宽神经网络中的泛化行为。
- 研究在无限集合中,是否可处理的信息论量可反映泛化性能。
- 分析在无限宽度极限下,表示、输入、目标与参数之间互信息的行为。
- 评估PAC-Bayes风格泛化界在此情形下的有效性。
- 探索梯度流下参数轨迹的信息几何结构。
提出的方法
- 建模通过平方损失进行梯度流训练的无限宽度神经网络的无限集合。
- 使用神经正切核(NTK)形式化描述网络动态,使输出分布可表示为条件高斯分布并实现闭式计算。
- 推导出互信息量的解析表达式:I(Z;Y)、I(Z;X|D)、I(Z;D|X) 和 I(Θ;D)。
- 采用变分界和变量变换公式,估算参数与数据之间的互信息。
- 利用NTK和初始权重协方差,计算参数空间中的费舍尔信息度量和参数轨迹长度。
- 采用高斯过程与线性代数技术,计算对随机初始化的期望值。
实验结果
研究问题
- RQ1在无限宽度网络的无限集合中,信息论量(如互信息)能否实现解析计算?
- RQ2这些量是否与无限宽度极限下的泛化性能相关?
- RQ3为何尽管泛化性能良好,PAC-Bayes界在此情形下仍会失效?
- RQ4与单个网络相比,集合平均如何压缩输入信息?
- RQ5参数轨迹长度与参数空间中的信息几何行为如何?
主要发现
- 即使训练时间趋于无穷,网络输出与输入之间的互信息 I(Z;X|D) 仍保持有限且较小,表明集合有效压缩了输入信息。
- 表示与目标之间的互信息 I(Z;Y) 在高斯数据上接近最优性能,趋近于理论信息瓶颈边界。
- 参数与数据之间的互信息 I(Θ;D) 随训练时间增加而发散,导致标准PAC-Bayes泛化界变得无意义。
- 费舍尔信息度量在参数空间中为常数且平坦,尽管训练时间无限,参数轨迹长度仍为有限值。
- 集合的输出分布为条件高斯分布,使所有关键信息论量均可实现闭式计算。
- 对于ReLU和Erf网络,在初始权重方差较小时观察到过拟合,且Erf非线性导致测试损失的发散更严重。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。