[论文解读] Deep Deterministic Information Bottleneck with Matrix-based Entropy Functional
本文提出深度确定性信息瓶颈(DIB),一种新颖方法,通过基于矩阵的Rényi α阶熵泛函,直接在深度神经网络中优化信息瓶颈原理,无需变分推断或分布假设。DIB在MNIST和CIFAR-10数据集上实现了最先进的泛化性能与鲁棒性,尤其在对抗性攻击下优于VIB及其他正则化方法。
We introduce the matrix-based Renyi's $α$-order entropy functional to parameterize Tishby et al. information bottleneck (IB) principle with a neural network. We term our methodology Deep Deterministic Information Bottleneck (DIB), as it avoids variational inference and distribution assumption. We show that deep neural networks trained with DIB outperform the variational objective counterpart and those that are trained with other forms of regularization, in terms of generalization performance and robustness to adversarial attack.Code available at https://github.com/yuxi120407/DIB
研究动机与目标
- 为解决高维深度学习中互信息计算的挑战,通过引入一种确定性、可微分的熵估计器,替代变分推断。
- 通过一种新型基于矩阵的Rényi α阶熵泛函,实现在深度神经网络中对信息瓶颈原理的直接优化。
- 相比现有的变分方法与基于正则化的技术,提升模型的泛化能力与对抗攻击下的鲁棒性。
- 证明对IB目标函数的确定性参数化可在表示学习中实现更优性能。
提出的方法
- 该方法提出一种基于矩阵的Rényi α阶熵泛函,其定义基于由核嵌入数据对构建的归一化格拉姆矩阵的特征值。
- 该熵泛函具有可微性,支持通过IB目标函数进行端到端反向传播,无需变分近似。
- 使用确定性熵估计器直接优化IB拉格朗日函数,替代VIB中使用的变分下界。
- 通过将瓶颈层视为表示T,将该方法应用于深度神经网络,互信息项通过基于矩阵的熵泛函计算。
- 该方法避免了分布假设与变分推断,实现了在IB原理下对深度网络的直接训练。
- 该框架采用标准深度学习架构(如MNIST的784-1024-1024-256-10,CIFAR-10的VGG16)并使用Adam/SGD优化。
实验结果
研究问题
- RQ1能否在信息瓶颈框架中,用确定性、可微分的熵估计器替代变分推断以应用于深度学习?
- RQ2与VIB及其他正则化方法相比,使用基于矩阵的Rényi熵直接优化IB目标是否能提升泛化能力与鲁棒性?
- RQ3基于矩阵的Rényi熵泛函是否可在无需分布假设的前提下有效用于训练深度神经网络?
- RQ4在对抗性攻击下,DIB相较于VIB与标准正则化技术的性能表现如何?
主要发现
- 在MNIST上,DIB实现1.13%的测试误差,优于VIB(1.17%)及其他正则化方法。
- 在CIFAR-10上,使用VGG16时,DIB将测试误差降低至5.66%,优于基线VGG16(7.36%)与VIB(9.31%)。
- DIB在FGSM对抗攻击下表现出显著提升的鲁棒性,尤其在CIFAR-10上,优于VIB、标签平滑与置信度惩罚方法。
- 采用DIB训练的模型表现出更低的泛化误差与更强的对抗鲁棒性,表明其表示质量更优。
- 基于矩阵的Rényi熵泛函被证实具有可微性,适用于端到端训练,支持IB的直接优化。
- 出人意料的是,在相同设置下,VIB在CIFAR-10上未提升性能,而DIB实现了显著增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。