Skip to main content
QUICK REVIEW

[论文解读] A Bayesian Perspective on Training Speed and Model Selection

Clare Lyle, Lisa Schut|arXiv (Cornell University)|Oct 27, 2020
Gaussian Processes and Bayesian Inference参考文献 43被引用 9
一句话总结

本文提出了一种贝叶斯框架,将线性模型和深度神经网络中的训练速度与边缘似然估计联系起来。通过证明按顺序处理数据时的训练对数似然之和(SOTL)近似于边缘似然,揭示了在模型选择和线性模型组合中,学习速度更快的模型更受青睐——为SGD在深度学习中为何能良好泛化提供了新的解释。

ABSTRACT

We take a Bayesian perspective to illustrate a connection between training speed and the marginal likelihood in linear models. This provides two major insights: first, that a measure of a model's training speed can be used to estimate its marginal likelihood. Second, that this measure, under certain conditions, predicts the relative weighting of models in linear model combinations trained to minimize a regression loss. We verify our results in model selection tasks for linear models and for the infinite-width limit of deep neural networks. We further provide encouraging empirical evidence that the intuition developed in these settings also holds for deep neural networks trained with stochastic gradient descent. Our results suggest a promising new direction towards explaining why neural networks trained with stochastic gradient descent are biased towards functions that generalize well.

研究动机与目标

  • 建立训练速度与贝叶斯模型选择中边缘似然之间的理论联系。
  • 开发一种计算高效的边缘似然估计器,其形式与标准SGD训练过程相匹配。
  • 研究以顺序数据的预测对数似然之和衡量的训练速度,是否能预测模型性能和线性组合中的权重分配。
  • 将线性模型中的洞察扩展至深度神经网络的无限宽极限,并通过实证方法加以验证。
  • 探讨这些原理是否适用于训练后的DNN中的子网络,从而提出一种网络内泛化偏差的机制。

提出的方法

  • 基于顺序贝叶斯更新中对先前数据点的预测对数似然之和,提出一族边缘似然估计器。
  • 利用线性模型和无限宽DNN中梯度下降可产生精确后验样本的事实,实现SOTL与边缘似然估计之间的精确对应。
  • 通过迭代贝叶斯更新,按顺序计算数据点的对数似然之和,形成SOTL估计器。
  • 将SOTL估计器应用于线性模型和无限宽DNN中的模型选择任务,并与精确边缘似然进行比较。
  • 通过实证评估SOTL作为测试准确率和SGD训练的线性集成中模型权重的代理指标。
  • 通过将倒数第二层激活视为独立模型,将分析扩展至DNN中的子网络,评估其在最终线性层中的最终权重。

实验结果

研究问题

  • RQ1以顺序处理数据的预测对数似然之和衡量的训练速度,能否作为贝叶斯模型选择中边缘似然的代理?
  • RQ2SOTL估计器是否能预测通过最小化回归损失训练的线性模型组合中各模型的相对权重?
  • RQ3SOTL与使用随机梯度下降训练的深度神经网络的泛化性能相关程度如何?
  • RQ4在训练后的DNN中是否存在一种机制——如对子网络的差异化加权——反映出在线性模型中观察到的对快速学习模型的偏好?
  • RQ5SOTL能否为SGD为何在有限宽网络中也偏好泛化性能良好的模型,提供一个合理的理论解释?

主要发现

  • 在线性模型和无限宽DNN中,按顺序处理数据的训练对数似然之和(SOTL)与边缘似然非常接近。
  • SOTL与测试集性能强相关:平均测试交叉熵较低的模型具有更高的SOTL值。
  • 在通过梯度下降训练的线性模型组合中,SOTL值更高的模型被赋予显著更大的最终权重。
  • 实证结果表明,SOTL能有效预测SGD训练的DNN的最终测试准确率,且在多种架构中均观察到强烈的正相关性。
  • 在DNN内部,作为独立模型的子网络(倒数第二层特征)若其SOTL值更高(即个体表现更好),则在最终线性层中被赋予更大的权重,表明存在对快速学习组件的偏好。
  • SOTL估计器为昂贵的变分推理提供了一种计算高效的替代方案,在精确计算可行的场景下,其跟踪边缘似然的能力非常接近。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。