Skip to main content
QUICK REVIEW

[论文解读] A Progressive Batching L-BFGS Method for Machine Learning

Raghu Bollapragada, Dheevatsa Mudigere|arXiv (Cornell University)|Feb 15, 2018
Stochastic Gradient Optimization Techniques参考文献 40被引用 57
一句话总结

引入 PBQN,一种渐进批量拟牛顿(progressive-batching quasi-Newton)算法,结合渐进采样、基于 Armijo 风格的随机化线搜索,以及稳定的 L-BFGS 更新,用于训练逻辑回归和深度网络,具有良好的泛化性和并行性。给出了对凸和非凸设定的收敛理论。

ABSTRACT

The standard L-BFGS method relies on gradient approximations that are not dominated by noise, so that search directions are descent directions, the line search is reliable, and quasi-Newton updating yields useful quadratic models of the objective function. All of this appears to call for a full batch approach, but since small batch sizes give rise to faster algorithms with better generalization properties, L-BFGS is currently not considered an algorithm of choice for large-scale machine learning applications. One need not, however, choose between the two extremes represented by the full batch or highly stochastic regimes, and may instead follow a progressive batching approach in which the sample size increases during the course of the optimization. In this paper, we present a new version of the L-BFGS algorithm that combines three basic components - progressive batching, a stochastic line search, and stable quasi-Newton updating - and that performs well on training logistic regression and deep neural networks. We provide supporting convergence theory for the method.

研究动机与目标

  • 推动使用渐进批量来将随机方法的速度与全批量拟牛顿方法的准确性融合在一起。
  • 开发一个 PBQN 算法,将渐进采样、随机线搜索和稳定的 L-BFGS 更新整合在一起。
  • 在渐进采样下为强凸和非凸目标提供收敛理论。
  • 在逻辑回归和神经网络上展示该方法,以评估性能和泛化能力。
  • 讨论实际方面及并行/分布式实现的潜力。

提出的方法

  • 提出 PBQN: x_{k+1} = x_{k} - α_{k} H_{k} g_{k}^{S_{k}},其中 H_{k} 来自 L-BFGS,g_{k}^{S_{k}} 为子采样梯度。
  • 使用渐进采样方案,当基于与真方向夹角的随机内积拟牛顿(IPQN)测试不满足时,批量大小 |S_{k}| 增加。
  • 将内积测试扩展到二阶方法,以确保搜索方向在高概率下与真实拟牛顿方向对齐。
  • 引入带初始步长 α_{k} 的 Armijo 风格回溯线搜索,借助方差信息估计(式 (Eq. 14))以确保期望下降。
  • 采用基于重叠的策略(y_{k} = g_{k+1}^{O_{k}} - g_{k}^{O_{k}})在迭代之间批量改变时稳定赫塞矩阵更新。
  • 提供两种计算 y_{k} 的选项:多批量(MB)含 25% 重叠和全重叠(FO)方法,并使用曲率条件 y_{k}^{T}s_{k} > ε‖s_{k}‖^{2} 作为更新资格条件。

实验结果

研究问题

  • RQ1渐进批量结合随机线搜索能否为拟牛顿更新在机器学习场景中提供可靠的下降方向?
  • RQ2与基于 SG 的方法相比,PBQN 方法在逻辑回归和深度神经网络上是否实现了具有竞争力的训练与泛化性能?
  • RQ3在渐进采样下,PBQN 对强凸与非凸问题有哪些收敛保证?
  • RQ4曲率对的批量重叠选择如何影响稳定性和性能?
  • RQ5PBQN 是否适用于具有良好可扩展性的并行/分布式实现?

主要发现

  • 在逻辑回归方面,PBQN 在训练误差、测试损失和测试准确度方面与 SG 和 SVRG 相当,且适用于不同数据集。
  • MB 曲率向量方法通常在逻辑回归实验中优于 FO。
  • 在神经网络中,PBQN 达到了与 SG 与 Adam 相当的最佳测试准确度,但迭代次数较少、梯度评估次数更多。
  • 来自方差基公式(式 Eq. 14)的初始步长被线搜索可靠接受,导致高效的回退。
  • 收敛理论显示在合适步长下对强凸 F 存在线性收敛性,对非凸 F 在标准光滑性与有界性假设下达到梯度范数收敛。
  • 由于二阶信息的存在,该方法几乎无需参数调优,并在所测试的问题中表现出鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。