Skip to main content
QUICK REVIEW

[论文解读] Invariance Learning in Deep Neural Networks with Differentiable Laplace Approximations

Alexander Immer, Tycho F. A. van der Ouderaa|arXiv (Cornell University)|Feb 22, 2022
Gaussian Processes and Bayesian Inference被引用 11
一句话总结

本文提出了一种可微分的贝叶斯方法,通过使用Kronecker分解的拉普拉斯近似来逼近边缘似然,实现深度神经网络中数据增强不变性的端到端学习。通过在无验证数据的情况下通过梯度下降优化不变性参数,该方法提升了泛化能力和数据效率,在图像基准测试中,准确率最高提升10个百分点,数据效率提升10倍,优于标准增强方法。

ABSTRACT

Data augmentation is commonly applied to improve performance of deep learning by enforcing the knowledge that certain transformations on the input preserve the output. Currently, the data augmentation parameters are chosen by human effort and costly cross-validation, which makes it cumbersome to apply to new datasets. We develop a convenient gradient-based method for selecting the data augmentation without validation data during training of a deep neural network. Our approach relies on phrasing data augmentation as an invariance in the prior distribution on the functions of a neural network, which allows us to learn it using Bayesian model selection. This has been shown to work in Gaussian processes, but not yet for deep neural networks. We propose a differentiable Kronecker-factored Laplace approximation to the marginal likelihood as our objective, which can be optimised without human supervision or validation data. We show that our method can successfully recover invariances present in the data, and that this improves generalisation and data efficiency on image datasets.

研究动机与目标

  • 为了自动化深度神经网络中数据增强变换的选择,消除对手动调参和交叉验证的依赖。
  • 为了在训练过程中通过梯度优化不变性参数(例如旋转、缩放)而不依赖验证数据。
  • 通过以可微分且可扩展的方式近似边缘似然,将贝叶斯模型选择扩展至深度神经网络。
  • 通过直接从数据中学习任务特定的不变性,提升泛化能力和数据效率。

提出的方法

  • 将数据增强形式化为输入扰动上的先验,通过在变换输入上进行平均来强制实现函数不变性。
  • 为具有不变性先验的贝叶斯神经网络,提出一种可微分的Kronecker分解拉普拉斯近似来逼近边缘似然。
  • 利用重参数化技巧推导出关于不变性参数的随机梯度,从而实现端到端优化。
  • 通过联合优化权重和不变性超参数,将不变性参数学习与标准神经网络训练相结合。
  • 采用可扩展的拉普拉斯近似来估计边缘似然,使深度网络中的梯度驱动贝叶斯模型选择成为可能。

实验结果

研究问题

  • RQ1能否在深度神经网络中通过梯度优化,从数据中自动学习不变性参数(例如旋转、缩放)?
  • RQ2与手工设计的增强方法相比,通过边缘似然近似实现的可微分贝叶斯模型选择是否能提升泛化能力和数据效率?
  • RQ3所提出的方法是否能在无验证数据或人工指定超参数的情况下学习到有意义的不变性?
  • RQ4在图像分类任务中,所学不变性方法的性能与标准数据增强基线相比如何?

主要发现

  • 与标准数据增强相比,该方法在原始MNIST、Fashion-MNIST和CIFAR-10数据集上的测试准确率最高提升了8–10个百分点。
  • 在图像数据集的随机子集上,该方法实现了最高10倍的数据效率提升,显著优于采用固定增强的基线方法。
  • 通过可视化和轨迹分析,所学习的不变性分布恢复了有意义的变换,如旋转和仿射扰动。
  • 该方法成功地通过梯度端到端优化了不变性参数,无需验证数据或超参数调优。
  • Kronecker分解的拉普拉斯近似实现了高效且可微分的边缘似然估计,使贝叶斯模型选择在深度网络中成为可行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。