Skip to main content
QUICK REVIEW

[论文解读] Normal Approximation for Stochastic Gradient Descent via Non-Asymptotic Rates of Martingale CLT

Andreas Anastasiou, Krishnakumar Balasubramanian|arXiv (Cornell University)|Apr 3, 2019
Stochastic Gradient Optimization Techniques参考文献 31被引用 5
一句话总结

本文通过一种新颖的非渐近鞅中心极限定理(CLT),建立了Polyak-Ruppert平均随机梯度下降(SGD)收敛到正态分布的非渐近收敛速率。通过结合Stein方法与Lindeberg论证,作者推导出多元鞅差序列的显式收敛速率,从而实现了SGD的有限样本置信区间与假设检验,其有效性超越了渐近近似。

ABSTRACT

We provide non-asymptotic convergence rates of the Polyak-Ruppert averaged stochastic gradient descent (SGD) to a normal random vector for a class of twice-differentiable test functions. A crucial intermediate step is proving a non-asymptotic martingale central limit theorem (CLT), i.e., establishing the rates of convergence of a multivariate martingale difference sequence to a normal random vector, which might be of independent interest. We obtain the explicit rates for the multivariate martingale CLT using a combination of Stein's method and Lindeberg's argument, which is then used in conjunction with a non-asymptotic analysis of averaged SGD proposed in [PJ92]. Our results have potentially interesting consequences for computing confidence intervals for parameter estimation with SGD and constructing hypothesis tests with SGD that are valid in a non-asymptotic sense.

研究动机与目标

  • 解决高维统计中关于平均SGD非渐近正态近似的开放问题。
  • 为二阶可微测试函数建立平均SGD收敛到正态分布的显式、非渐近收敛速率。
  • 提出一个具有可量化速率的非渐近多变量鞅CLT,适用于随机优化。
  • 实现在基于SGD的参数估计中有限样本不确定性量化,克服渐近正态性带来的局限。

提出的方法

  • 通过结合Stein方法与Lindeberg论证,为多元鞅差序列推导出非渐近鞅CLT。
  • 收敛速率以Wasserstein距离表示,针对一阶与二阶导数有界的测试函数建立。
  • 利用Hessian光滑性与强凸性假设,控制SGD迭代中高阶余项。
  • 将[35]中平均SGD的非渐近分析与新提出的鞅CLT相结合,以界定正态近似误差。
  • 关键步骤包括利用矩界与逆Hessian的谱范数,对残差项 $ I_1, I_3, I_4 $ 的范数进行有界控制。
  • 以步长 $ \theta_t $、Hessian光滑常数 $ L_H $ 以及条件数 $ \frac{\nu}{\nu} $ 表示显式误差界。

实验结果

研究问题

  • RQ1在温和正则性条件下,平均SGD收敛到正态分布的非渐近收敛速率是什么?
  • RQ2能否通过Stein方法建立具有显式误差界的非渐近多变量鞅CLT?
  • RQ3在高维设定下,SGD中正态近似误差如何在有限时间推断中进行量化?
  • RQ4这些界对在有限样本情形下构建有效置信区间与假设检验有何影响?

主要发现

  • 本文建立了具有显式收敛速率的非渐近多变量鞅CLT,该速率以Wasserstein距离表示,适用于二阶可微测试函数。
  • 平均SGD收敛到正态分布的收敛速率被界定为 $ O\left( \frac{\|\Sigma_t^{-1/2}\|_2}{t} \sum_{j=1}^{t-1} \sqrt{\eta_j} \right) $,其中 $ \eta_j $ 为步长。
  • 残差项 $ I_4 $ 的误差界按 $ \frac{\|\Sigma_t^{-1/2}\|_2 L_H}{t} \sum_{j=1}^{t-1} \sqrt{\eta_j} $ 缩放,反映了Hessian光滑性与步长衰减的影响。
  • 通过 $ \mathbb{E}[\|\Delta_j\|_2] \leq \sqrt{\frac{2C}{\mu} \eta_j} $ 的矩控制,对残差期望范数 $ \mathbb{E}[\|I_4\|_2] $ 进行有界控制,其与强凸性参数 $ \mu $ 相关联。
  • 该方法可生成不依赖渐近近似的SGD有限样本置信区间。
  • 结果为在线学习与基于SGD的统计推断中的不确定性量化提供了理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。