[论文解读] On the Acceleration of L-BFGS with Second-Order Information and Stochastic Batches
该论文提出了一种使用随机小批量和近似海森矩阵或费舍尔信息矩阵以加速有限和优化中收敛的稳定二阶 L-BFGS 框架。该方法在凸和非凸问题上均实现了线性收敛,并在大批次大小的分布式设置下,性能优于 SGD、ADAM 和标准 L-BFGS。
This paper proposes a framework of L-BFGS based on the (approximate) second-order information with stochastic batches, as a novel approach to the finite-sum minimization problems. Different from the classical L-BFGS where stochastic batches lead to instability, we use a smooth estimate for the evaluations of the gradient differences while achieving acceleration by well-scaling the initial Hessians. We provide theoretical analyses for both convex and nonconvex cases. In addition, we demonstrate that within the popular applications of least-square and cross-entropy losses, the algorithm admits a simple implementation in the distributed environment. Numerical experiments support the efficiency of our algorithms.
研究动机与目标
- 解决有限和问题中由噪声梯度差引起的随机 L-BFGS 不稳定性问题。
- 开发一种稳定且高效的 L-BFGS 变体,利用二阶信息(海森矩阵或费舍尔矩阵)以实现更快收敛。
- 通过使用费舍尔信息矩阵近似曲率,实现可扩展的分布式部署。
- 为凸与非凸有限和最小化问题建立线性收敛保证。
- 在逻辑回归和神经网络训练中,证明该方法在实际性能上优于 ADAM、SGD 和标准 L-BFGS。
提出的方法
- 提出 LBFGS-H,通过使用梯度差的平滑估计来稳定随机 L-BFGS 中的曲率近似。
- 提出 LBFGS-F,用费舍尔信息矩阵替代海森矩阵近似,以提高稳定性并支持分布式计算。
- 采用两重循环递归与有限内存(m)机制,高效地利用曲率对 (s_k, y_k) 计算搜索方向。
- 使用线搜索或固定步长策略确定学习率,确保目标函数充分下降。
- 通过使用良好缩放的初始海森矩阵 H_k^0,维持稳定性并加速收敛。
- 通过将海森矩阵更新替换为费舍尔信息矩阵,实现分布式部署,降低通信与计算成本。
实验结果
研究问题
- RQ1能否在不引入不稳定性的情况下,有效将二阶信息融入随机 L-BFGS?
- RQ2使用梯度差的平滑估计是否能提高随机 L-BFGS 中的收敛稳定性?
- RQ3在分布式环境中,使用费舍尔信息矩阵的 LBFGS-F 是否能实现与标准 L-BFGS 相当或更优的性能?
- RQ4所提出的框架是否对凸与非凸有限和问题均实现线性收敛?
- RQ5在分布式训练中,该算法在不同小批量大小(尤其是大批次)下的表现如何?
主要发现
- 在标准假设下,LBFGS-H 对凸与非凸有限和问题均实现线性收敛至最优解的邻域。
- LBFGS-F 在分布式环境中表现出稳定且快速的收敛,优于 ADAM、ADAGRAD 和 SGD,尤其在大批次大小下表现更优。
- 数值实验表明,LBFGS-H 在 100 个随机种子下保持一致性能,而 ADAM 和 SGD 在大批次下性能显著下降。
- 在大批次大小(如 4096)下,LBFGS-H 显著减少达到目标精度所需的训练轮数,从而最小化分布式系统中的通信成本。
- 该算法的计算时间在单个 GPU 上直至批次大小 2^6 时几乎保持不变,表明其可扩展至更大批次。
- LBFGS-S(一种基线随机 L-BFGS 变体)表现出高度不稳定性与缓慢收敛,验证了所提出平滑化与海森/费舍尔近似方法的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。