[论文解读] Inverting Supervised Representations with Autoregressive Neural Density Models
本文提出使用自回归神经密度模型来反转深度神经网络中的监督表示,从而实现对中间特征条件下输入分布的可视化。该方法提供了输入与隐藏层之间互信息的可扩展、精确的密度估计,揭示了在训练过程中信息含量先增加后减少——这支持了ReLU-卷积网络中的信息瓶颈理论。
We present a method for feature interpretation that makes use of recent advances in autoregressive density estimation models to invert model representations. We train generative inversion models to express a distribution over input features conditioned on intermediate model representations. Insights into the invariances learned by supervised models can be gained by viewing samples from these inversion models. In addition, we can use these inversion models to estimate the mutual information between a model's inputs and its intermediate representations, thus quantifying the amount of information preserved by the network at different stages. Using this method we examine the types of information preserved at different layers of convolutional neural networks, and explore the invariances induced by different architectural choices. Finally we show that the mutual information between inputs and network layers decreases over the course of training, supporting recent work by Shwartz-Ziv and Tishby (2017) on the information bottleneck theory of deep learning.
研究动机与目标
- 通过建模隐藏特征条件下的输入分布,开发一种解释监督深度网络中间表示的方法。
- 提供一种可扩展且精确的互信息估计方法,以克服先前非参数化或基于优化方法的局限性。
- 分析架构选择与训练动态如何影响卷积神经网络中的信息保留与不变性。
- 通过追踪训练过程中互信息的变化,实证验证ReLU-卷积网络中的信息瓶颈理论。
提出的方法
- 该方法训练自回归神经密度模型以学习条件分布 p(x|h),其中 h 是预训练分类器的隐藏表示。
- 自回归结构将联合输入分布分解为像素维度上的条件乘积,从而实现精确的密度估计。
- 通过从反演模型的负交叉熵推导出的下界来估计输入与表示之间的互信息。
- 该方法仅使用单一优化目标,无需对抗训练,从而确保在高维输入下的稳定性和可扩展性。
- 在多个网络层和不同训练阶段训练反演模型,以分析信息流动与压缩动力学。
- 该方法应用于 MNIST 及其他图像数据集,并比较常规训练与过拟合训练制度下的表现。
实验结果
研究问题
- RQ1我们如何可视化映射到深度神经网络中给定中间表示的输入分布?
- RQ2在 ReLU-卷积网络的训练过程中,输入与隐藏表示之间的互信息在多大程度上发生变化?
- RQ3架构选择与训练制度如何影响深度网络中的不变性与信息压缩?
- RQ4自回归密度模型是否能比非参数化或基于优化的方法提供更准确且可扩展的互信息估计?
主要发现
- 输入与中间表示之间的互信息在训练过程中先增加后减少,与信息瓶颈理论预测的扩展与压缩阶段一致。
- 该方法再现了 ReLU-卷积网络中的信息瓶颈动力学,反驳了近期关于此类模型中不存在压缩的论断。
- 在仅使用 100 个样本训练的过拟合网络中,互信息下界显著更高,表明压缩与泛化性能相关。
- 反演模型能基于隐藏表示生成多样化且逼真的样本,揭示了网络学习到的不变性,如平移和尺度鲁棒性。
- 自回归密度模型提供了稳定、可扩展且精确的互信息估计,在高维设置下优于非参数化与对抗性方法。
- 该方法通过可视化激活特定表示的输入类型,实现了对架构选择的可解释性,提供了超越点估计重建的洞察。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。