Skip to main content
QUICK REVIEW

[论文解读] The Promises and Pitfalls of Deep Kernel Learning

Sebastian W. Ober, Carl Edward Rasmussen|arXiv (Cornell University)|Feb 24, 2021
Gaussian Processes and Bayesian Inference参考文献 53被引用 14
一句话总结

本文研究深度核学习(DKL),揭示了通常被认为可防止过拟合的边缘似然优化,实际上在过参数化的DKL模型中可能加剧泛化性能下降。作者证明,通过哈密顿蒙特卡洛(HMC)或SGLD对神经网络权重进行完全贝叶斯处理,其在不确定性校准和测试性能方面优于标准DKL模型,甚至优于确定性神经网络。

ABSTRACT

Deep kernel learning (DKL) and related techniques aim to combine the representational power of neural networks with the reliable uncertainty estimates of Gaussian processes. One crucial aspect of these models is an expectation that, because they are treated as Gaussian process models optimized using the marginal likelihood, they are protected from overfitting. However, we identify situations where this is not the case. We explore this behavior, explain its origins and consider how it applies to real datasets. Through careful experimentation on the UCI, CIFAR-10, and the UTKFace datasets, we find that the overfitting from overparameterized maximum marginal likelihood, in which the model is "somewhat Bayesian", can in certain scenarios be worse than that from not being Bayesian at all. We explain how and when DKL can still be successful by investigating optimization dynamics. We also find that failures of DKL can be rectified by a fully Bayesian treatment, which leads to the desired performance improvements over standard neural networks and Gaussian processes.

研究动机与目标

  • 探究深度核学习(DKL)是否如普遍所认为的那样,通过边缘似然优化可靠地防止过拟合。
  • 识别在具有大量超参数的过参数化设置下,DKL因过拟合而失效的条件。
  • 评估对神经网络权重进行完全贝叶斯处理是否能够克服标准DKL的局限性。
  • 在包括UCI、CIFAR-10和UTKFace在内的多种数据集上,比较DKL、标准神经网络和完全贝叶斯DKL的性能。
  • 评估在高维超参数空间中,对数边缘似然作为模型选择标准的可靠性。

提出的方法

  • 在1D合成数据、UCI数据集、CIFAR-10和UTKFace上实证评估DKL,以分析过拟合与不确定性校准情况。
  • 使用哈密顿蒙特卡洛(HMC)从神经网络权重和GP超参数的完整后验分布中进行采样,验证完全贝叶斯推理的有效性。
  • 应用随机梯度朗之万动力学(SGLD)将贝叶斯推理扩展至CIFAR-10和UTKFace等大规模数据集。
  • 使用测试均方根误差(RMSE)、对数似然(LL)、期望校准误差(ECE)和测试准确率等指标进行性能比较。
  • 通过端到端优化对数边缘似然(LML)训练DKL模型,将神经网络权重视为超参数。
  • 使用神经网络将输入映射到特征空间,该空间随后作为具有学习核函数的高斯过程的输入。

实验结果

研究问题

  • RQ1在过参数化模型中,DKL的边缘似然优化是否如普遍假设的那样可靠地防止过拟合?
  • RQ2在何种条件下,DKL的过拟合程度会超过标准确定性神经网络?
  • RQ3对DKL中神经网络权重进行完全贝叶斯处理是否能够解决标准DKL中观察到的过拟合问题?
  • RQ4在不确定性校准和预测准确性方面,完全贝叶斯DKL与标准DKL和确定性神经网络相比表现如何?
  • RQ5当超参数数量较大时,对数边缘似然是否仍是DKL中可靠的模型选择标准?

主要发现

  • 通过最大边缘似然优化的DKL模型可能比标准确定性神经网络出现更严重的过拟合,尤其是在随机正则化有限的情况下。
  • DKL中的过拟合源于边缘似然鼓励所有数据点之间的相关性,而不仅仅是具有实际关联的数据点,从而导致泛化性能下降。
  • 在1D合成数据集上,基于HMC的完全贝叶斯推理完全解决了过拟合问题,并在外部区域也产生了校准良好的不确定性估计。
  • 基于SGLD的完全贝叶斯DKL在UTKFace和CIFAR-10上提升了测试对数似然并降低了期望校准误差(ECE),优于标准DKL和贝叶斯神经网络。
  • 在UTKFace数据集上,完全贝叶斯SVDKL的测试RMSE为0.16±0.00,测试对数似然为0.42±0.03,优于确定性神经网络(RMSE: 0.16±0.00,LL: 0.39±0.04)。
  • 在CIFAR-10上,完全贝叶斯SVDKL的测试对数似然为-1.11±0.02,ECE为0.13±0.00,显著优于确定性神经网络(LL: -1.89±0.02,ECE: 0.18±0.00)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。