Skip to main content
QUICK REVIEW

[论文解读] Approximate Inference Turns Deep Networks into Gaussian Processes

Mohammad Emtiyaz Khan, Alexander Immer|arXiv (Cornell University)|Jun 5, 2019
Gaussian Processes and Bayesian Inference参考文献 22被引用 13
一句话总结

本文建立了贝叶斯深度神经网络(DNN)中高斯后验近似与高斯过程(GP)后验之间的理论等价性,使得在标准DNN训练过程中能够提取GP核函数和非线性特征映射。令人惊讶的是,推导出的核函数等价于神经正切核(NTK),从而实现通过GP边缘似然进行DNN超参数调优,而无需交叉验证。

ABSTRACT

Deep neural networks (DNN) and Gaussian processes (GP) are two powerful models with several theoretical connections relating them, but the relationship between their training methods is not well understood. In this paper, we show that certain Gaussian posterior approximations for Bayesian DNNs are equivalent to GP posteriors. This enables us to relate solutions and iterations of a deep-learning algorithm to GP inference. As a result, we can obtain a GP kernel and a nonlinear feature map while training a DNN. Surprisingly, the resulting kernel is the neural tangent kernel. We show kernels obtained on real datasets and demonstrate the use of the GP marginal likelihood to tune hyperparameters of DNNs. Our work aims to facilitate further research on combining DNNs and GPs in practical settings.

研究动机与目标

  • 建立深度神经网络(DNN)训练过程与高斯过程(GP)之间的理论联系。
  • 证明贝叶斯DNN中的高斯后验近似(如拉普拉斯近似、变分推理)在数学上等价于GP后验。
  • 实现在标准DNN训练过程中提取GP核函数与非线性特征映射。
  • 证明推导出的核函数对应于神经正切核(NTK),并提供其自然出现的新视角。
  • 通过GP边缘似然实现DNN超参数的实用调优,避免交叉验证。

提出的方法

  • 在贝叶斯DNN上使用高斯后验近似(拉普拉斯近似与变分推理)以推导出等价的GP后验分布。
  • 从DNN权重后验近似的角度推导出相应的GP核函数与非线性特征映射。
  • 证明所得核函数等价于神经正切核(NTK),该核函数由DNN输出的雅可比矩阵导出。
  • 将DNN2GP框架应用于真实数据集(如MNIST与CIFAR)上的训练DNN,以提取特征映射与核函数。
  • 利用从DNN2GP转换中计算出的GP边缘似然,对DNN超参数(如正则化强度、噪声方差、网络宽度)进行调优。
  • 在合成数据集与真实数据集(如UCI红葡萄酒质量数据集)上验证该方法,比较基于边缘似然与测试损失的超参数选择结果。

实验结果

研究问题

  • RQ1贝叶斯DNN中的高斯后验近似能否被正式映射为GP后验?
  • RQ2通过近似推理从DNN训练中推导出的核函数是否等价于神经正切核(NTK)?
  • RQ3从DNN训练中获得的GP边缘似然能否有效用于DNN超参数调优?
  • RQ4从DNN中提取的特征映射与对应GP核函数之间存在何种关系?
  • RQ5通过GP边缘似然选择的超参数与通过标准测试误差选择的超参数在真实世界DNN中表现如何?

主要发现

  • 通过拉普拉斯近似或变分推理实现的贝叶斯DNN中的高斯后验近似,在数学上等价于GP回归模型中的后验。
  • 从DNN训练过程中推导出的核函数等价于神经正切核(NTK),并自然地从后验近似中浮现。
  • 使用DNN2GP框架从训练好的DNN中提取的非线性特征映射能够捕捉有意义的表示,且在MNIST与CIFAR数据集上可视化效果良好。
  • 从DNN2GP转换中计算出的GP边缘似然能够选择出使测试误差较低的DNN超参数(如正则化强度、网络宽度、噪声方差),其性能与交叉验证相当。
  • 在合成数据集与真实世界数据集(如UCI红葡萄酒质量数据集)上,通过GP边缘似然选择的超参数泛化能力良好,证明其作为超参数调优目标的可行性。
  • 该框架实现了DNN与GP的无缝集成,使得无需架构修改即可在标准DNN上使用GP推理工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。