Skip to main content
QUICK REVIEW

[论文解读] Diverse Ensembles Improve Calibration

Asa Cooper Stickland, Iain Murray|arXiv (Cornell University)|Jul 8, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用 13
一句话总结

本文提出了一种简单但有效的方法,通过为每个集成模型成员量身定制多样化的数据增强(如对抗性扰动、AugMix 和随机深度),来提升深度神经网络集成模型的校准性能。通过以较小概率混合未增强的输入,该方法在 i.i.d. 和分布外数据上均提升了校准性能与准确率,在 CIFAR-10 和 CIFAR-100 基准测试中优于强基线模型。

ABSTRACT

Modern deep neural networks can produce badly calibrated predictions, especially when train and test distributions are mismatched. Training an ensemble of models and averaging their predictions can help alleviate these issues. We propose a simple technique to improve calibration, using a different data augmentation for each ensemble member. We additionally use the idea of `mixing' un-augmented and augmented inputs to improve calibration when test and training distributions are the same. These simple techniques improve calibration and accuracy over strong baselines on the CIFAR10 and CIFAR100 benchmarks, and out-of-domain data from their corrupted versions.

研究动机与目标

  • 解决深度神经网络在分布偏移下预测校准不足的问题。
  • 在不增加计算成本的前提下,提升集成模型的校准性能与泛化能力。
  • 探究为每个集成成员应用多样化数据增强是否能提升模型校准性能。
  • 评估混合未增强与增强输入对校准性能的影响。

提出的方法

  • 为每个集成成员应用不同的数据增强方法(对抗性扰动、AugMix、随机深度),以提升多样性。
  • 使用 BatchEnsemble 以共享大部分模型参数,降低训练与存储成本。
  • 引入随机混合策略:以概率 p 使用未增强输入;否则使用增强输入。
  • 对于对抗性扰动,使用修改后的快速梯度符号法生成输入,结合随机缩放与类似丢弃的掩码机制。
  • 对于 AugMix,通过伯努利试验选择原始图像或增强图像,简化原始方法,避免使用贝塔分布。
  • 使用共享权重矩阵 W 与可学习的适配向量 r_i 和 s_i,高效参数化每个集成成员。

实验结果

研究问题

  • RQ1为每个集成成员应用不同数据增强是否能提升在 i.i.d. 和分布外数据上的模型校准性能?
  • RQ2在 i.i.d. 测试集上,混合未增强与增强输入如何影响校准与准确率?
  • RQ3当训练与测试分布不一致时,为每个成员使用多样化增强是否能减少校准偏差?
  • RQ4增强策略的选择(如对抗性增强 vs. AugMix)是否会影响在损坏数据上的性能?
  • RQ5性能提升是源于集成多样性,还是特定形式的数据增强?

主要发现

  • 与非多样化集成相比,为每个集成成员应用不同增强强度,使 CIFAR-10-C 上的 ECE 降低了 1.4 个百分点,CIFAR-100-C 上降低了 1.2 个百分点。
  • 混合未增强输入(p=0.875)在 i.i.d. 数据上提升了校准性能,与始终使用增强输入相比,CIFAR-10 上的 ECE 降低了 0.3 个百分点。
  • 对抗性扰动与 AugMix 的组合表现最佳,在 CIFAR-10-C 上达到 10.9% 的错误率,优于 Hendrycks 等人(2020)的 34.9% 错误率。
  • 在分布外数据上,采用多样化增强的集成模型始终表现出优于非多样化模型的校准性能,尽管准确率相近。
  • 仅使用增强输入(p=1.0)会降低 i.i.d. 数据上的性能,表明接触分布内样本对校准至关重要。
  • 该方法在 CIFAR-10 和 CIFAR-100 上均优于强基线,在所有基准测试中均取得了最先进的校准与准确率表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。