Skip to main content
QUICK REVIEW

[论文解读] High Probability Convergence of Clipped-SGD Under Heavy-tailed Noise

Ta Duy Nguyen, Thien Hang Nguyen|arXiv (Cornell University)|Feb 10, 2023
Stochastic Gradient Optimization Techniques被引用 4
一句话总结

本文在仅假设梯度噪声的 $p$-阶矩有界($p \in (1,2]$)且具有重尾分布的条件下,为裁剪SGD建立了高概率收敛边界。该研究提出了一套新颖的分析框架,实现了时间最优的收敛速率(对数因子内最优)。该方法仅需极少假设,且在无需动量或有界梯度假设的前提下,实现了对噪声自适应的收敛速率。

ABSTRACT

While the convergence behaviors of stochastic gradient methods are well understood \emph{in expectation}, there still exist many gaps in the understanding of their convergence with \emph{high probability}, where the convergence rate has a logarithmic dependency on the desired success probability parameter. In the \emph{heavy-tailed noise} setting, where the stochastic gradient noise only has bounded $p$-th moments for some $p\in(1,2]$, existing works could only show bounds \emph{in expectation} for a variant of stochastic gradient descent (SGD) with clipped gradients, or high probability bounds in special cases (such as $p=2$) or with extra assumptions (such as the stochastic gradients having bounded non-central moments). In this work, using a novel analysis framework, we present new and time-optimal (up to logarithmic factors) \emph{high probability} convergence bounds for SGD with clipping under heavy-tailed noise for both convex and non-convex smooth objectives using only minimal assumptions.

研究动机与目标

  • 填补在重尾梯度噪声下传统方差假设失效时,对随机一阶方法理论理解的空白。
  • 克服现有高概率收敛结果依赖强假设(如有界非中心矩或域直径约束)的局限性。
  • 在最小假设(即有界 $p$-阶矩噪声)下,为凸与非凸光滑目标函数建立时间最优的高概率收敛性。
  • 实现对噪声自适应的收敛速率:随着噪声水平降低,收敛速率趋近于确定性速率,且无需动量或梯度归一化。
  • 提供一个适用于凸与非凸场景的通用分析框架,统一了在重尾噪声下的收敛保证。

提出的方法

  • 提出一种带有简单梯度裁剪机制的裁剪SGD算法,不使用动量。
  • 引入一种新颖的集中分析框架,以在仅依赖有界 $p$-阶矩的重尾噪声下控制噪声迭代值的偏离。
  • 利用高概率鞅集中不等式,控制梯度范数的累积偏离,其中裁剪阈值被选择以平衡偏差与方差。
  • 推导出一种自适应步长调度策略,该策略根据噪声水平 $\sigma$、时间范围 $T$ 和矩参数 $p$ 进行调整,确保最优收敛速率。
  • 通过将迭代值递归分解为偏差与噪声分量,并应用链式论证来控制平方偏离和的上界。
  • 利用一个关键引理来控制偏离项的二阶矩,从而通过精心选择与 $\sigma^p$ 和 $T$ 相关的参数 $G$ 实现高概率控制。

实验结果

研究问题

  • RQ1在仅假设 $p \in (1,2]$ 的有界 $p$-阶矩噪声下,能否建立裁剪SGD的高概率收敛性?
  • RQ2所提方法在重尾噪声下,对凸与非凸目标函数是否均能达到时间最优的收敛速率(对数因子内最优)?
  • RQ3收敛保证能否实现对噪声的自适应性:随着噪声水平降低而改善,且无需有界梯度或非中心矩假设?
  • RQ4能否在不依赖动量或有界域直径等额外假设的前提下,实现高概率收敛?
  • RQ5能否为凸与非凸场景在重尾噪声下建立统一的分析框架?

主要发现

  • 本文在仅假设梯度噪声的 $p$-阶矩有界($p \in (1,2]$)这一最小条件下,建立了裁剪SGD在凸与非凸光滑目标函数下的高概率收敛性。
  • 收敛速率在 $T$ 和成功概率 $\delta$ 上达到时间最优(对数因子内),与期望情形下的已知下界一致。
  • 该方法实现了对噪声自适应的收敛速率:随着噪声水平 $\sigma$ 降低,收敛速率趋近于确定性速率。
  • 该分析无需有界梯度、非中心矩或域直径约束,与先前工作形成对比。
  • 步长自适应地根据 $\sigma$、$T$、$p$ 和问题的光滑性参数 $L$ 选择,确保最优量纲缩放。
  • 以高概率 $1 - \delta$,平均平方梯度范数被控制在 $\mathcal{O}\left(\sqrt{\Delta_1 L} \ln \frac{4T}{\delta} \cdot T^{\frac{2-2p}{3p-2}} \max\left\{ \sigma^{\frac{p}{p-1}}, T^{\frac{1-2p}{3p-2}} \right\} \right)$ 以内,从而实现了期望的收敛速率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。