[论文解读] Bayesian Image Classification with Deep Convolutional Gaussian Processes
本文提出了用于深度卷积高斯过程的翻译不变性卷积核(TICK),通过放宽严格的平移不变性要求,提升了图像分类任务中的不确定性校准与准确性。该方法在MNIST和CIFAR-10上均达到最先进性能,优于标准卷积高斯过程及基于Dropout的贝叶斯深度学习方法,在准确率与基于边际似然的超参数调优方面表现更优。
In decision-making systems, it is important to have classifiers that have calibrated uncertainties, with an optimisation objective that can be used for automated model selection and training. Gaussian processes (GPs) provide uncertainty estimates and a marginal likelihood objective, but their weak inductive biases lead to inferior accuracy. This has limited their applicability in certain tasks (e.g. image classification). We propose a translation-insensitive convolutional kernel, which relaxes the translation invariance constraint imposed by previous convolutional GPs. We show how we can use the marginal likelihood to learn the degree of insensitivity. We also reformulate GP image-to-image convolutional mappings as multi-output GPs, leading to deep convolutional GPs. We show experimentally that our new kernel improves performance in both single-layer and deep models. We also demonstrate that our fully Bayesian approach improves on dropout-based Bayesian deep learning methods in terms of uncertainty and marginal likelihood estimates.
研究动机与目标
- 解决现有卷积高斯过程强制实施严格平移不变性所带来的局限,该限制限制了模型在图像数据上的灵活性与性能。
- 通过引入更灵活的归纳偏置,改进贝叶斯图像分类中的不确定性量化与模型校准。
- 通过在全贝叶斯框架中使用边际似然,实现超参数的自动选择,克服基于Dropout的贝叶斯深度学习中的一个关键局限。
- 将深度卷积高斯过程层重新表述为相关多输出高斯过程,以支持高效、可扩展的训练与推理。
- 证明:即使在应用贝叶斯推理的情况下,先验中更优的归纳偏置也能带来更优的后验近似与模型性能。
提出的方法
- 提出翻译不变性卷积核(TICK),放宽相同图像块必须产生相同输出的要求,从而支持更灵活的特征学习。
- 将深度高斯过程中的图像到图像卷积映射重新表述为多输出高斯过程,利用通用多输出高斯过程框架实现高效推理。
- 采用带诱导点的随机变分推理,使模型在保持计算效率的同时可扩展至大规模数据集。
- 将边际似然作为超参数优化的目标函数,实现自动模型选择与正则化。
- 在可重用、开源的多输出高斯过程框架(van der Wilk et al., 2020)中实现该模型,支持模块化与可扩展代码。
- 将模型应用于单层与深层架构,一致地优于标准卷积高斯过程及贝叶斯深度学习基线模型。
实验结果
研究问题
- RQ1在卷积高斯过程中放宽平移不变性,是否能提升图像分类任务的性能?
- RQ2所提出的多输出高斯过程形式是否能实现深度卷积高斯过程的高效且可扩展的训练?
- RQ3在所提出的框架中,边际似然能否有效用于自动超参数调优,而不同于基于Dropout的贝叶斯深度学习中的不可靠估计?
- RQ4与基于Dropout的贝叶斯神经网络相比,该方法在标准图像基准上的不确定性校准效果如何?
- RQ5先验中改进的归纳偏置在多大程度上能转化为更优的后验近似与模型性能?
主要发现
- Deep TICK-GP在MNIST上达到99.33%的top-1准确率,优于标准深度GP的98%与非卷积深度GP的98%。
- 在CIFAR-10上,Deep TICK-GP达到74.41%的top-1准确率,显著优于非卷积深度GP基线的47.26%。
- 在3层设置下,该模型将MNIST的top-1错误率降低至0.64%,优于标准卷积高斯过程的0.93%,表明准确率提升。
- 在3层MNIST设置下,该模型的NLL为0.02,负ELBO为4.19 × 10³,表明其不确定性校准与模型拟合优于基线。
- 所提出方法的边际似然估计可用于超参数选择,而基于Dropout的贝叶斯深度学习中此类估计不可靠。
- TICK核在MNIST与CIFAR-10的所有深度设置下均持续优于标准卷积高斯过程,在准确率与不确定性量化方面均有提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。