Skip to main content
QUICK REVIEW

[论文解读] Adapting the Linearised Laplace Model Evidence for Modern Deep Learning

Javier Antorán, David M. Janz|UvA-DARE (University of Amsterdam)|Jun 17, 2022
Gaussian Processes and Bayesian Inference被引用 5
一句话总结

本文识别出经典线性化拉普拉斯方法与现代深度学习训练实践(尤其是随机优化和归一化层)之间的关键不相容性,并提出两项关键改进:使用线性化模型的最优参数 θ⋆ 代替原始训练点 θ̃ 进行线性化,以及为归一化与非归一化参数分别建模先验。这些改进显著提升了在 ResNet、Transformer 和自编码器等多种架构中模型证据估计与不确定性校准的性能。

ABSTRACT

The linearised Laplace method for estimating model uncertainty has received renewed attention in the Bayesian deep learning community. The method provides reliable error bars and admits a closed-form expression for the model evidence, allowing for scalable selection of model hyperparameters. In this work, we examine the assumptions behind this method, particularly in conjunction with model selection. We show that these interact poorly with some now-standard tools of deep learning--stochastic approximation methods and normalisation layers--and make recommendations for how to better adapt this classic method to the modern setting. We provide theoretical support for our recommendations and validate them empirically on MLPs, classic CNNs, residual networks with and without normalisation layers, generative autoencoders and transformers.

研究动机与目标

  • 解决经典线性化拉普拉斯方法在应用于使用随机优化和归一化层训练的现代深度学习模型时表现不佳的问题。
  • 指出标准线性化拉普拉斯方法假设训练点 θ̃ 是损失最小值,而这一假设在实践中常因训练未收敛而失效。
  • 通过为归一化与非归一化参数分别引入独立的先验参数化方式,解决归一化层网络中预测分布定义不清的问题。
  • 通过基于线性化模型最优参数的修正目标函数,实现更准确的模型证据估计,从而改进模型选择。
  • 证明所提出方法在多种架构与数据集上均能获得更优的校准不确定性估计与更高的测试对数似然。

提出的方法

  • 用基于线性化模型最优参数 θ⋆ 的新目标函数,替代标准线性化拉普拉斯方法中使用的原始训练点 θ̃ 的模型证据,通过求解凸优化问题实现。
  • 推导出一种修正后的模型证据表达式,以考虑线性化模型的损失曲面特性,确保在训练未收敛时仍与真实后验保持更好对齐。
  • 提出双先验形式化方法,分别对归一化与非归一化网络参数建模先验分布,解决含批量归一化等层的网络中的问题。
  • 将新的模型证据目标函数应用于超参数选择,实现对正则化参数的可微、凸且可扩展的优化。
  • 利用神经正切核(NTK)框架形式化线性化模型,并为所提方法的理论性质提供理论依据。
  • 在多层感知机(MLP)、卷积神经网络(CNN)、ResNet(含与不含归一化)、Transformer 和自编码器上进行实证验证,比较不确定性校准与预测性能。

实验结果

研究问题

  • RQ1为何经典线性化拉普拉斯方法在应用于使用随机优化训练的现代深度学习模型时,难以提供可靠的模型证据估计?
  • RQ2当训练点 θ̃ 并非训练损失的最小值时,线性化拉普拉斯方法应如何调整以保持有效性?
  • RQ3为何线性化拉普拉斯中的预测分布会在归一化层网络中变得定义不清?该问题如何得以修正?
  • RQ4使用线性化模型的最优参数 θ⋆ 代替原始训练点 θ̃,是否能带来更优的校准不确定性估计与更优的模型证据?
  • RQ5所提方法是否能在多种架构与数据集上,优于标准线性化拉普拉斯方法,在测试对数似然与不确定性校准方面表现更优?

主要发现

  • 使用线性化模型的最优参数 θ⋆ 代替训练点 θ̃,可显著提升模型证据估计的准确性,尤其在训练未收敛时效果更明显。
  • 基于 θ⋆ 的模型证据始终优于使用 θ̃ 的标准方法,测试对数似然提升显著,在 CIFAR10 上使用 ResNet-50 时最高提升达 0.5 对数似然单位。
  • 在 MNIST 上的 ResNet-18 中,使用多层特定正则化参数的所提方法,测试负对数似然达 0.003 ± 0.000,显著优于单个 λ 参数下的标准方法(0.520 ± 0.009)。
  • 针对归一化层的双先验方法成功解决了预测分布定义不清的问题,使批量归一化网络中的不确定性估计更加可靠。
  • 实证结果表明,所提方法生成的不确定性估计更具校准性,其预测标准差与自编码器任务中的实际重构误差高度一致。
  • 使用新目标函数 Mθ⋆ 进行超参数优化时收敛稳定,而标准方法 Mθ̃ 导致正则化参数发散至零,表明其存在不稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。