Skip to main content
QUICK REVIEW

[论文解读] Calibrating Deep Convolutional Gaussian Processes

Gia-Lac Tran, Edwin V. Bonilla|arXiv (Cornell University)|May 26, 2018
Gaussian Processes and Bayesian Inference参考文献 24被引用 14
一句话总结

本文提出了一种新型的深度卷积神经网络,其高斯过程层通过随机特征近似(cnn+gp(rf)),在实现最先进图像分类性能的同时保持了良好的校准性。通过结合变分推断与蒙特卡洛丢弃,该方法实现了可靠的不确定性量化,优于先前的CNN-GP混合模型,甚至在不牺牲校准性的情况下超越了部分标准CNN的准确率。

ABSTRACT

The wide adoption of Convolutional Neural Networks (CNNs) in applications where decision-making under uncertainty is fundamental, has brought a great deal of attention to the ability of these models to accurately quantify the uncertainty in their predictions. Previous work on combining CNNs with Gaussian processes (GPs) has been developed under the assumption that the predictive probabilities of these models are well-calibrated. In this paper we show that, in fact, current combinations of CNNs and GPs are miscalibrated. We proposes a novel combination that considerably outperforms previous approaches on this aspect, while achieving state-of-the-art performance on image classification tasks.

研究动机与目标

  • 调查现有CNN-高斯过程组合的校准特性,尽管其具有贝叶斯性质,但常被假设为校准良好,本文表明其实际存在校准偏差。
  • 开发一种新型深度学习架构,将CNN与GP层以保持高准确率的同时确保预测概率的良好校准性。
  • 通过小批量更新与GPU加速,实现模型的可扩展端到端训练,使其适用于实际应用。
  • 证明通过变分近似结合丢弃的贝叶斯推断可提升校准性,且不损害性能。

提出的方法

  • 用通过随机特征近似的高斯过程替换CNN的全连接层,实现高效且可扩展的推断。
  • 使用蒙特卡洛丢弃作为变分推断的近似方法,实现CNN卷积核与GP参数的端到端联合训练。
  • 利用随机特征近似与贝叶斯深度神经网络之间的等价性,简化实现过程。
  • 在深层架构中应用结构化随机特征,提升GP近似的效率与紧凑性。
  • 采用多项式似然与贝叶斯正则化,促进输出结果的良好校准性。
  • 使用小批量随机优化训练模型,实现在CIFAR-10与CIFAR-100等大规模数据集上的可扩展性。

实验结果

研究问题

  • RQ1尽管具有贝叶斯性质,现有CNN与高斯过程的组合是否真正校准良好?
  • RQ2能否设计一种CNN-GP混合模型,实现最先进准确率与良好校准的不确定性估计?
  • RQ3通过随机特征近似替换全连接层为GP层,是否能在保持性能的同时提升校准性?
  • RQ4模型深度如何影响CNN-GP混合模型的校准性?正则化能否缓解此问题?
  • RQ5蒙特卡洛丢弃能否有效实现CNN卷积核与GP参数的可扩展联合推断?

主要发现

  • 所提出的cnn+gp(rf)模型在CIFAR-10上达到约89%的准确率,在CIFAR-100上达到约75%的准确率,无需数据增强,优于先前的CNN-GP组合。
  • 该模型保持了强校准性,即使在增加模型深度时,期望校准误差(ECE)仍维持在约3%,显著优于先前的CNN-GP方法。
  • 该方法因采用多项式似然与贝叶斯正则化而实现良好校准,而先前的CNN-GP混合模型则因校准偏差而表现不佳。
  • 在分布外数据(如not-MNIST)上,该模型展现出更优的不确定性估计,对错误类别表现出更高的熵值,优于基线方法。
  • 蒙特卡洛丢弃实现了CNN卷积核与GP参数的有效联合训练,使该方法具备可扩展性且易于实现。
  • 将最后一层替换为使用结构化随机特征的深度高斯过程,进一步提升了性能,同时保持了良好的校准性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。