[论文解读] Layer-wise Learning of Stochastic Neural Networks with Information Bottleneck
该论文提出了信息多瓶颈(IMBs),作为信息瓶颈原理的多瓶颈扩展,以显式优化随机神经网络各层的压缩与相关性权衡。通过将每一层建模为具有可学习参数的独立瓶颈,IMBs在MNIST和CIFAR10数据集上的分类准确率和对抗鲁棒性均优于最大似然估计(MLE),证明了其在深层表征中更优的信息利用能力。
Information Bottleneck (IB) is a generalization of rate-distortion theory that naturally incorporates compression and relevance trade-offs for learning. Though the original IB has been extensively studied, there has not been much understanding of multiple bottlenecks which better fit in the context of neural networks. In this work, we propose Information Multi-Bottlenecks (IMBs) as an extension of IB to multiple bottlenecks which has a direct application to training neural networks by considering layers as multiple bottlenecks and weights as parameterized encoders and decoders. We show that the multiple optimality of IMB is not simultaneously achievable for stochastic encoders. We thus propose a simple compromised scheme of IMB which in turn generalizes maximum likelihood estimate (MLE) principle in the context of stochastic neural networks. We demonstrate the effectiveness of IMB on classification tasks and adversarial robustness in MNIST and CIFAR10.
研究动机与目标
- 解决深度神经网络中缺乏系统化、逐层压缩与相关性优化的问题。
- 将信息瓶颈原理扩展至多个瓶颈,将神经网络每一层建模为独立的瓶颈。
- 为随机神经网络中的最大似然估计(MLE)原则提供一个理论基础更坚实的替代方案。
- 通过实证验证IMBs在隐藏表征中比MLE更有效地利用信息。
- 通过显式、逐层的信息权衡优化,提升泛化能力和对抗鲁棒性。
提出的方法
- 将信息瓶颈(IB)原理扩展至多个瓶颈,定义IMB为一个拉格朗日函数,用于平衡每一层表征与输入之间的互信息(压缩)以及每一层与目标之间的互信息(相关性)。
- 将每一层神经网络建模为随机编码器与解码器,其参数定义了条件分布 p(z_l|x) 和 p(y|z_l)。
- 使用变分推断通过变分界近似不可计算的互信息项 I(Z_l;X) 和 I(Z_l;Y)。
- 应用梯度估计技术优化IMB目标的变分下界,实现端到端训练。
- 引入一种折衷训练方案,以处理随机编码器中多个瓶颈之间存在的冲突最优性问题。
- 采用多阶段训练目标,按层平衡压缩与相关性,每层使用独立的 β_l。
实验结果
研究问题
- RQ1信息瓶颈原理能否在深度神经网络中被有意义地扩展至多个瓶颈?
- RQ2是否可能在随机神经网络中同时实现所有层的最优压缩与相关性权衡?
- RQ3IMB目标在表征学习质量与下游性能方面与MLE相比如何?
- RQ4显式逐层信息优化是否能提升泛化能力与对抗鲁棒性?
- RQ5在IMB与MLE训练过程中,各层间互信息动态变化的差异是什么?
主要发现
- IMBs在MNIST和CIFAR10上的分类准确率优于MLE,且在对抗鲁棒性方面表现出一致的提升。
- 与MLE相比,IMB训练网络中表征的相关性(I(Z_l;Y))增长更快并稳定在更高水平,表明信息利用更充分。
- IMB训练网络中的压缩性(I(Z_l;X))表现出更强的“弯曲效应”,表明其压缩更有效且更具显式性。
- MLE目标在训练初期即达到局部最小值,阻碍表征实现最优信息权衡;而IMB则持续在各层优化表征。
- IMB使深层网络能维持更高的相关性与更有效的压缩,表明其更好地利用了分层表征学习机制。
- IMB目标的变分近似使表征学习过程比MLE更稳定、更具信息量,尤其在训练初期阶段。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。