Skip to main content
QUICK REVIEW

[论文解读] Guided Deep Kernel Learning

Idan Achituve, Gal Chechik|arXiv (Cornell University)|Feb 19, 2023
Gaussian Processes and Bayesian Inference被引用 5
一句话总结

本文提出了一种新型方法——引导式深度核学习(Guided Deep Kernel Learning, GDKL),该方法利用神经网络高斯过程(Neural Network Gaussian Processes, NNGPs)的不确定性估计来指导深度核学习(Deep Kernel Learning, DKL)模型的训练。通过将DKL后验分布与NNGP的预测分布对齐,GDKL在保持DKL的可扩展性和泛化能力的同时,实现了更稳健的不确定性量化并减少了过拟合,在多种基准数据集上优于标准DKL和基线方法。

ABSTRACT

Combining Gaussian processes with the expressive power of deep neural networks is commonly done nowadays through deep kernel learning (DKL). Unfortunately, due to the kernel optimization process, this often results in losing their Bayesian benefits. In this study, we present a novel approach for learning deep kernels by utilizing infinite-width neural networks. We propose to use the Neural Network Gaussian Process (NNGP) model as a guide to the DKL model in the optimization process. Our approach harnesses the reliable uncertainty estimation of the NNGPs to adapt the DKL target confidence when it encounters novel data points. As a result, we get the best of both worlds, we leverage the Bayesian behavior of the NNGP, namely its robustness to overfitting, and accurate uncertainty estimation, while maintaining the generalization abilities, scalability, and flexibility of deep kernels. Empirically, we show on multiple benchmark datasets of varying sizes and dimensionality, that our method is robust to overfitting, has good predictive performance, and provides reliable uncertainty estimations.

研究动机与目标

  • 解决深度核学习(DKL)模型中常见的过拟合和不可靠不确定性估计问题。
  • 在保留高斯过程的贝叶斯优势(尤其是对过拟合的鲁棒性和准确的不确定性)的同时,保持深度神经网络的表达能力和可扩展性。
  • 开发一种利用无限宽神经网络先验(NNGPs)指导DKL优化的训练方法,以提升泛化能力和不确定性校准。
  • 通过标准技术(如诱导点)支持GDKL中的精确推理和近似推理,确保实际可扩展性。

提出的方法

  • GDKL通过最小化一个损失函数来训练DKL模型,该损失函数结合了数据似然项和DKL后验与NNGP后验之间的KL散度项。
  • NNGP为每个测试点提供可靠且贝叶斯化的不确定性估计,用于校准DKL模型预测的置信度。
  • 对于测试集中的每个数据点,DKL模型的预测分布被鼓励与NNGP的后验相匹配,尤其是在不确定性较高的区域。
  • 该目标函数等价于变分推断目标,其中DKL充当编码标签信息的变分后验,同时受NNGP先验的正则化。
  • 该方法支持精确推理和通过诱导点实现的近似推理,从而实现对更大数据集的可扩展性。
  • 训练过程涉及将随机数据划分为${\mathcal{D}}_1$(用于计算NNGP后验)和${\mathcal{D}}_2$(用于训练DKL模型),损失在${\mathcal{D}}_2$上计算。

实验结果

研究问题

  • RQ1无限宽神经网络(NNGPs)的不确定性估计是否可用于改善深度核学习(DKL)模型的泛化能力和鲁棒性?
  • RQ2与标准DKL相比,使用NNGP后验指导DKL训练是否能减少过拟合,特别是在小规模和中等规模数据集上?
  • RQ3所得到的模型是否能在保持高预测性能的同时,提供比标准DKL和竞争方法更可靠的不确定性量化?
  • RQ4所提出的方法是否具备可扩展性,并与标准近似推理技术(如诱导点)兼容?

主要发现

  • 与标准DKL相比,GDKL显著减少了过拟合,在小规模和中等规模数据集上表现出更优的泛化能力。
  • 该方法实现了更优的不确定性估计,其预测分布校准良好,能准确反映真实不确定性,尤其在分布外区域表现突出。
  • 在多个维度和规模各异的基准数据集上,GDKL在预测准确率和不确定性量化指标上均优于标准DKL和基线方法。
  • 所提出的损失函数等价于最大化变分下界(ELBO),验证了该方法在贝叶斯推断中的理论基础。
  • 使用NNGP先验使DKL模型能够避免训练点之间过度相关联,这是先前研究中识别出的DKL过拟合的关键原因。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。