Skip to main content
QUICK REVIEW

[论文解读] Diversity inducing Information Bottleneck in Model Ensembles

Samarth Sinha, Homanga Bharadhwaj|arXiv (Cornell University)|Mar 10, 2020
Adversarial Robustness in Machine Learning参考文献 46被引用 12
一句话总结

本文提出 DIBS(模型集成中的多样性诱导信息瓶颈),一种通过联合优化预测似然、信息瓶颈正则化以及随机潜在变量的对抗性多样性来提升深度集成性能的方法。通过使用共享编码器和 K 个随机解码器头,并引入对抗性多样性损失,DIBS 在 MNIST、CIFAR100、TinyImageNet 和 Places2 上实现了超过 10% 的相对准确率提升,数据分布偏移下的泛化性能提升超过 5%,并展现出更优的分布外(OOD)检测能力。

ABSTRACT

Although deep learning models have achieved state-of-the-art performance on a number of vision tasks, generalization over high dimensional multi-modal data, and reliable predictive uncertainty estimation are still active areas of research. Bayesian approaches including Bayesian Neural Nets (BNNs) do not scale well to modern computer vision tasks, as they are difficult to train, and have poor generalization under dataset-shift. This motivates the need for effective ensembles which can generalize and give reliable uncertainty estimates. In this paper, we target the problem of generating effective ensembles of neural networks by encouraging diversity in prediction. We explicitly optimize a diversity inducing adversarial loss for learning the stochastic latent variables and thereby obtain diversity in the output predictions necessary for modeling multi-modal data. We evaluate our method on benchmark datasets: MNIST, CIFAR100, TinyImageNet and MIT Places 2, and compared to the most competitive baselines show significant improvements in classification accuracy, under a shift in the data distribution and in out-of-distribution detection. Code will be released in this url https://github.com/rvl-lab-utoronto/dibs

研究动机与目标

  • 解决贝叶斯神经网络和随机集成在数据分布偏移下泛化能力不足以及对多模态数据建模能力有限的问题。
  • 通过显式鼓励集成预测中存在多样且合理的假设,改进预测不确定性估计。
  • 开发一种可扩展、原理严谨的集成方法,平衡高似然性与多样性,且不依赖随机权重初始化或先验假设。
  • 通过受控的信息流与多样性强制机制,实现对高维输入(如图像)中多模态数据分布的有效建模。

提出的方法

  • 一个共享的确定性编码器将输入 X 映射到共享潜在变量 Z,实现集成成员之间的共享表征学习。
  • K 个随机解码器头将 Z 映射到 K 个不同的输出 Yi,每个代表一个具有独立预测的集成模型。
  • 应用对抗性多样性损失以最大化不同解码器头之间预测结果的差异性,促进生成不同的假设。
  • 信息瓶颈约束通过最小化输入 X 与每个潜在解码器变量 Z̃i 之间的互信息,确保仅保留相关统计特征。
  • 训练目标联合最大化数据似然性、通过对抗性损失实现的多样性以及信息瓶颈正则化。
  • 该方法具有通用性,适用于任意潜在变量模型,且不依赖随机初始化来实现多样性。

实验结果

研究问题

  • RQ1在集成模型中显式引入多样性是否能提升在数据分布偏移下的泛化能力以及分布外(OOD)检测性能?
  • RQ2将信息瓶颈正则化与对抗性多样性损失结合,是否能实现比随机初始化或贝叶斯方法更优的不确定性估计?
  • RQ3使用共享编码器与多个随机解码器的结构是否能在保持可扩展性的前提下,超越标准集成方法在准确率与多样性上的表现?
  • RQ4与 MC-dropout 和贝叶斯神经网络相比,该方法在建模多模态数据分布方面表现如何?

主要发现

  • DIBS 在 MNIST、CIFAR100、TinyImageNet 和 MIT Places 2 上相较于最先进基线方法,分类准确率提升超过 10% 的相对幅度。
  • 该方法在数据分布偏移下表现出超过 5% 的相对泛化性能提升,表明对分布偏移具有更强鲁棒性。
  • DIBS 改进了分布外检测性能,预测不确定性估计在 AUROC 和 AUPR 指标上均提升超过 5%。
  • 对抗性多样性损失有效促进了有意义的预测多样性,同时未损害预测似然性或泛化能力。
  • 信息瓶颈约束防止了预测结果的过度发散,确保多样性与预测保真度之间的平衡。
  • 在所有基准数据集上,DIBS 在 AUROC 和 AUPR 指标上均优于随机集成和 NCP 基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。