Skip to main content
QUICK REVIEW

[论文解读] Stochastic Gradient and Langevin Processes

Xiang Cheng, Dong Yin|arXiv (Cornell University)|Jul 7, 2019
Stochastic Gradient Optimization Techniques被引用 10
一句话总结

本文为具有非高斯、状态相关噪声的离散朗之万过程建立了定量收敛速率,表明小步长的随机梯度下降(SGD)可近似为一个极限SDE。在势函数和噪声协方差的温和正则性条件下,即使噪声为非高斯分布,本文证明了欧拉-牟拉雅马离散化和SGD均以 $ O(δ^{1/8}) $ 的速率在Wasserstein-1距离下收敛到SDE的不变分布。

ABSTRACT

We prove quantitative convergence rates at which discrete Langevin-like processes converge to the invariant distribution of a related stochastic differential equation. We study the setup where the additive noise can be non-Gaussian and state-dependent and the potential function can be non-convex. We show that the key properties of these processes depend on the potential function and the second moment of the additive noise. We apply our theoretical findings to studying the convergence of Stochastic Gradient Descent (SGD) for non-convex problems and corroborate them with experiments using SGD to train deep neural networks on the CIFAR-10 dataset.

研究动机与目标

  • 为了理解SGD作为非凸优化中采样算法的有限时间收敛性,特别是其泛化行为。
  • 将先前对朗之万MCMC的分析扩展到非高斯和状态相关噪声的设置,这类噪声在SGD中很常见。
  • 建立离散过程与其连续时间SDE极限之间离散化误差的严格界。
  • 证明即使噪声为非高斯分布,极限SDE的不变分布仍能控制SGD的行为。
  • 通过在CIFAR-10上对深度神经网络使用SGD,对理论发现进行实证验证。

提出的方法

  • 提出一种具有状态相关、非高斯噪声的一般离散朗之万型过程:$ w_{(k+1)\delta} = w_{k\delta} - \delta \nabla U(w_{k\delta}) + \sqrt{\delta} \xi(w_{k\delta}, \eta_k) $。
  • 将极限SDE定义为 $ dx_t = -\nabla U(x_t) dt + M(x_t) dB_t $,其中 $ M(x) $ 为噪声协方差矩阵的平方根。
  • 使用一种新颖的李雅普诺夫函数和耦合技术,证明其收敛至不变分布 $ p^* $。
  • 在Wasserstein-1距离下,建立离散过程(1)、其欧拉-牟拉雅马近似(2)与连续SDE(3)之间的离散化误差界。
  • 应用一个定量中心极限定理(定理5),以证明可用具有相同协方差的高斯噪声来近似非高斯噪声。
  • 通过在CIFAR-10上训练残差网络类CNN并采用不同噪声分布,实证验证了理论结果,表明测试误差与噪声协方差密切相关。

实验结果

研究问题

  • RQ1在非高斯和状态相关噪声下,离散朗之万过程与其连续SDE极限之间的离散化误差如何随步长 $ \delta $ 变化?
  • RQ2能否严格建立具有非高斯、状态相关噪声的SGD与极限SDE之间的联系?其收敛至不变分布的速率如何?
  • RQ3即使噪声为非高斯分布,极限SDE的不变分布是否仅依赖于噪声协方差?
  • RQ4在深度学习模型上,理论收敛速率 $ O(\delta^{1/8}) $ 是否能在实践中观察到?
  • RQ5噪声协方差矩阵在预测SGD训练模型的泛化性能(测试误差)方面是否具有强预测能力?

主要发现

  • 欧拉-牟拉雅马近似(2)与连续SDE(3)之间的离散化误差在Wasserstein-1距离下为 $ O(\sqrt{\delta}) $。
  • 欧拉-牟拉雅马过程(2)收敛至不变分布 $ p^* $ 的速率为 $ O(\sqrt{\delta}) $,当 $ n \geq \tilde{O}(1/\delta) $ 时成立。
  • 实际SGD型过程(1)与SDE(3)之间的离散化误差为 $ O(\delta^{1/8}) $,其收敛至 $ p^* $ 的速率同样为 $ O(\delta^{1/8}) $。
  • 只要噪声协方差表现良好,收敛速率 $ O(\delta^{1/8}) $ 对非高斯噪声具有鲁棒性。
  • 在CIFAR-10上的实证结果表明,即使噪声分布变化,测试误差仍能被噪声协方差矩阵强烈预测。
  • 理论框架证明SGD可被视为一种采样算法,其收敛分布由势函数和噪声协方差决定,而不仅由梯度决定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。