Skip to main content
QUICK REVIEW

[论文解读] Learning-Rate-Free Learning by D-Adaptation

Aaron Defazio, Konstantin Mishchenko|arXiv (Cornell University)|Jan 18, 2023
Machine Learning and Algorithms被引用 5
一句话总结

本文提出 D-Adaptation,一种无需超参数的优化方法,通过维持到最优解初始距离的下界,自动为随机梯度下降(SGD)及其变体 Adam 调整学习率。该方法在无需线搜索或额外梯度评估的前提下,实现了凸 Lischitz 函数的最优 O(1/√n) 收敛速率,在视觉、自然语言处理和推荐系统等多样化机器学习任务中,性能与人工调优的学习率相当。

ABSTRACT

D-Adaptation is an approach to automatically setting the learning rate which asymptotically achieves the optimal rate of convergence for minimizing convex Lipschitz functions, with no back-tracking or line searches, and no additional function value or gradient evaluations per step. Our approach is the first hyper-parameter free method for this class without additional multiplicative log factors in the convergence rate. We present extensive experiments for SGD and Adam variants of our method, where the method automatically matches hand-tuned learning rates across more than a dozen diverse machine learning problems, including large-scale vision and language problems. An open-source implementation is available.

研究动机与目标

  • 消除随机优化中针对凸 Lischitz 函数进行手动学习率调优的需求。
  • 开发一种方法,在无需额外函数评估或回溯搜索的情况下,实现最优的 O(1/√n) 收敛速率。
  • 提供一种无需超参数的自适应方法,替代如 AdaGrad-Norm 等现有方法,后者需要知晓到解的初始距离。
  • 实现在包括大规模视觉与语言模型在内的多样化机器学习问题中,自动且稳健的性能表现。
  • 推导出一种理论基础坚实的自适应学习率策略,通过经验梯度动态界定到最优解的距离上界。

提出的方法

  • D-Adaptation 使用加权对偶平均法,其自适应步长基于梯度范数倒数的运行估计值推导得出。
  • 通过一种新颖的边界公式,利用累积梯度与步长,维持对初始距离 D = ||x₀ − x*|| 的下界 ˆdk。
  • 使用公式 ˆdk+1 = (γk+1||sk+1||² − Σγi d²i ||gi||²)/(2||sk+1||) 更新下界 ˆdk+1,其中 sk+1 为累积梯度。
  • 当获得更紧致的估计 ˆdk+1 时,动态提升下界 dk,确保渐近收敛至最优速率。
  • 对于 Adam 变体,该方法对梯度的指数移动平均(EMA)进行调整,并基于 EMA 的平方梯度计算归一化步长。
  • 该方法仅依赖于观测到的梯度与累积和,避免了线搜索与额外的梯度评估。

实验结果

研究问题

  • RQ1一种无需超参数的优化方法,是否能在无需线搜索或额外函数评估的前提下,实现凸 Lischitz 函数的最优 O(1/√n) 收敛速率?
  • RQ2如何仅利用观测到的梯度与步长,自适应地估计到解的初始距离下界?
  • RQ3D-Adaptation 是否在包括视觉、自然语言处理与推荐系统在内的多样化机器学习任务中,达到与人工调优学习率相当的性能?
  • RQ4D-Adaptation 的理论收敛保证是什么?其与 AdaGrad-Norm 等现有自适应方法相比有何差异?
  • RQ5该方法能否扩展至 Adam 变体,同时保持理论收敛性与实际性能?

主要发现

  • D-Adaptation 在凸 Lischitz 函数上实现了最优的 O(DG/√n) 收敛速率,且不引入额外的对数因子,与最坏情况下的下界一致。
  • 该方法渐近收敛速率为 O(DG/√n + 1),通过经验梯度追踪,对 D 的下界随时间不断改善。
  • 在非渐近设置下,收敛速率被限制在 O(DG log₂⁺(D/d₀)/√n),显著优于使用固定 d₀ 的基线次梯度方法。
  • 实验表明,D-Adaptation 在超过十项多样化的机器学习问题中,性能与人工调优学习率相当或更优,涵盖视觉与语言模型。
  • D-Adaptation 的 Adam 变体在无需手动调整学习率的情况下,仍保持强大性能,展现出在各类任务中的鲁棒性。
  • 理论分析表明,对 D 的下界渐近下界为 D/(1+√3),确保收敛至最优速率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。