Skip to main content
QUICK REVIEW

[论文解读] Empirical study towards understanding line search approximations for training neural networks

Younghwan Chae, Daniël N. Wilke|arXiv (Cornell University)|Sep 15, 2019
Stochastic Gradient Optimization Techniques参考文献 42被引用 8
一句话总结

本文研究了在使用小批量子采样进行随机神经网络训练时,基于二次线搜索近似的性能,比较了函数值与方向导数的效用。研究发现,方向导数信息——尤其是初始点处的方向导数——对于减少步长预测中的方差至关重要,而选择性地使用最少且相关的信息,优于使用更随意的数据。

ABSTRACT

Choosing appropriate step sizes is critical for reducing the computational cost of training large-scale neural network models. Mini-batch sub-sampling (MBSS) is often employed for computational tractability. However, MBSS introduces a sampling error, that can manifest as a bias or variance in a line search. This is because MBSS can be performed statically, where the mini-batch is updated only when the search direction changes, or dynamically, where the mini-batch is updated every-time the function is evaluated. Static MBSS results in a smooth loss function along a search direction, reflecting low variance but large bias in the estimated "true" (or full batch) minimum. Conversely, dynamic MBSS results in a point-wise discontinuous function, with computable gradients using backpropagation, along a search direction, reflecting high variance but lower bias in the estimated "true" (or full batch) minimum. In this study, quadratic line search approximations are considered to study the quality of function and derivative information to construct approximations for dynamic MBSS loss functions. An empirical study is conducted where function and derivative information are enforced in various ways for the quadratic approximations. The results for various neural network problems show that being selective on what information is enforced helps to reduce the variance of predicted step sizes.

研究动机与目标

  • 理解在动态小批量子采样下,构建二次线搜索近似时,函数值与方向导数的相对价值。
  • 评估不同组合的函数值与导数信息如何影响随机梯度下降中预测步长的方差与准确性。
  • 确定使用更多信息(如多次函数评估)是否能提升性能,还是选择性地使用最少信息(尤其是方向导数)更为有效。
  • 评估各种近似策略在随机优化下,针对不同神经网络架构与数据集的鲁棒性。

提出的方法

  • 在搜索方向的不同步长处,使用函数值与方向导数的组合,构建五种不同的1D二次近似。
  • 以三种方式强制引入信息:仅使用函数值(f-f-f)、仅使用方向导数(g-g),以及包含函数值在α₀与α₁处、导数在α₀处(fg-f)、在α₁处(f-fg)或两者均有的混合配置(fg-fg)。
  • 以精确线搜索作为基线进行比较,评估对象包括逻辑回归、MNIST、CIFAR-10以及更深的网络。
  • 通过收敛速度、步长方差以及有效(正值)步长的比例来衡量性能,重点关注随机设置下的稳定性与准确性。
  • 在随机非负梯度投影(NN-GPP)框架中应用这些近似,以定位方向导数的符号变化,从而实现稳健的步长估计。
  • 在静态与动态小批量子采样设置下评估近似方法,重点聚焦于动态MBSS,其中不连续性使线搜索更加复杂。

实验结果

研究问题

  • RQ1在动态小批量子采样下,包含函数值与方向导数如何影响预测步长的方差?
  • RQ2使用更多函数评估是否能提高线搜索近似的准确性,还是会增加偏差与不稳定性?
  • RQ3初始点处的方向导数信息是否比其他点更有利于减少步长方差?
  • RQ4是否可以仅使用最少且选择性的信息(如仅初始方向导数)来超越更全面但随意的数据收集?
  • RQ5为何某些近似(如f-f-f、f-fg)尽管使用了更多数据,却仍无法产生有效步长,而其他近似(如fg-f、g-g)却保持稳定?

主要发现

  • 初始点处的方向导数信息对于减少预测步长的方差以及确保下降方向的一致性至关重要。
  • 仅使用方向导数的g-g近似和仅在α₀处使用导数的fg-f近似,在稳定性与收敛性方面优于所有其他配置。
  • 完全依赖函数值的近似(如f-f-f、f-fg)在小批量设置下频繁产生无效步长(α < 0),这是由于二阶多项式拟合存在高偏差。
  • 尽管fg-fg近似使用了更多信息,但在某些情况下仍会失败,原因在于近似构造存在偏差,表明信息量多并不保证质量高。
  • 即使数据有限,方向导数信息也能带来更低的方差与更优的性能,优于仅使用大量函数值的情况。
  • g-g与fg-f近似在收敛性能上可与精确线搜索相媲美,尽管初始进展略慢,但随着时间推移,其步长选择持续改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。