Skip to main content
QUICK REVIEW

[论文解读] Efficient Full-Matrix Adaptive Regularization

Naman Agarwal, Brian Bullins|arXiv (Cornell University)|Jun 8, 2018
Sparse and Compressive Sensing Techniques被引用 12
一句话总结

该论文提出 GGT,一种可扩展的算法,通过计算基于最近梯度滑动窗口的低秩 Hessian 近似矩阵的逆平方根,实现非凸优化中高效全矩阵自适应正则化。该方法在迭代收敛速度上优于 Adam 等对角自适应方法,尤其在病态或复杂损失曲面(如 RNN 训练)中表现更优,且具有依赖于自适应比率的理论收敛速率保证。

ABSTRACT

Adaptive regularization methods pre-multiply a descent direction by a preconditioning matrix. Due to the large number of parameters of machine learning problems, full-matrix preconditioning methods are prohibitively expensive. We show how to modify full-matrix adaptive regularization in order to make it practical and effective. We also provide a novel theoretical analysis for adaptive regularization in non-convex optimization settings. The core of our algorithm, termed GGT, consists of the efficient computation of the inverse square root of a low-rank matrix. Our preliminary experiments show improved iteration-wise convergence rates across synthetic tasks and standard deep learning benchmarks, and that the more carefully-preconditioned steps sometimes lead to a better solution.

研究动机与目标

  • 解决大规模深度学习模型中全矩阵自适应正则化的计算不可行性问题。
  • 开发一种实用且可扩展的方法,实现全矩阵预条件化,而无需承担矩阵求逆的高昂代价。
  • 首次为随机非凸优化中的自适应正则化提供理论收敛性分析。
  • 通过实证验证,全矩阵预条件化相较于对角自适应方法能实现更快、更鲁棒的训练。
  • 证明 GGT 在复杂、各向异性的损失曲面(如 RNN)中优于现有优化器(如 Adam)

提出的方法

  • GGT 计算滑动窗口内最近梯度的梯度 Gram 矩阵的低秩近似矩阵的逆平方根。
  • 该方法使用指数衰减窗口,以保持对内存友好的低秩梯度二阶矩矩阵。
  • 采用数值稳定且 GPU 友好的算法,计算该低秩矩阵的逆平方根与向量的乘积。
  • 通过秩-1 更新增量式地更新预条件矩阵,避免存储和求逆完整矩阵。
  • 该算法设计为 Adam 的即插即用替代品,对优化循环的修改极少。
  • 理论分析引入一个自适应比率 μ,用于量化相对于 SGD 的改进,收敛速率依赖于 μ。

实验结果

研究问题

  • RQ1能否使大规模深度学习模型中的全矩阵自适应正则化在计算上变得可行?
  • RQ2在病态或复杂损失曲面中,全矩阵预条件化是否能比对角自适应方法带来更快的收敛速度?
  • RQ3能否为随机非凸优化中的自适应正则化建立理论收敛保证?
  • RQ4与 SGD 相比,自适应比率 μ 如何影响收敛速率?
  • RQ5全矩阵预条件化对 RNN 及其他复杂模型的训练动态有何影响?

主要发现

  • GGT 在标准深度学习基准测试中,相较于 Adam 及其他对角自适应方法,实现了更快的迭代收敛速度,尤其在病态问题中表现更优。
  • 在合成实验中,GGT 在病态问题上显著优于基线方法,且收敛性能的提升随条件数增加而增强。
  • 在 RNN 训练中,GGT 展现出显著的性能优势,与高达约 10^6 的条件数相关,表明其对各向异性曲率具有更强的处理能力。
  • 理论分析表明,GGT 可在 Õ(μ²σ²/ε⁴) 次随机梯度调用内收敛至 ε-近似一阶临界点,且自适应比率 μ 提升了相对于 SGD 的收敛速率。
  • 该算法的运行时间与当前最先进优化器相当,使其在大规模模型中具备实用性。
  • 实证结果证实,更精确的预条件化步长可带来更好的泛化性能和更快的训练速度,尤其在复杂、非凸的损失曲面中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。