[论文解读] Stochastic model-based minimization under high-order growth
该论文提出了一种基于随机模型的优化框架,用于处理非光滑、非凸优化问题,采用Bregman散度来建模近似误差和稳定性。在高阶增长条件下,该框架建立了关于平稳性度量的 $ O(k^{-1/4}) $ 收敛速率,并在凸性与相对强凸性条件下分别提升至 $ O(k^{-1/2}) $ 和 $ \widetilde{O}(k^{-1}) $,并应用于随机镜像下降与正则化高斯-牛顿方法。
Given a nonsmooth, nonconvex minimization problem, we consider algorithms that iteratively sample and minimize stochastic convex models of the objective function. Assuming that the one-sided approximation quality and the variation of the models is controlled by a Bregman divergence, we show that the scheme drives a natural stationarity measure to zero at the rate $O(k^{-1/4})$. Under additional convexity and relative strong convexity assumptions, the function values converge to the minimum at the rate of $O(k^{-1/2})$ and $\widetilde{O}(k^{-1})$, respectively. We discuss consequences for stochastic proximal point, mirror descent, regularized Gauss-Newton, and saddle point algorithms.
研究动机与目标
- 将标准随机模型优化方法推广至非全局Lipschitz设定,使用Bregman散度替代欧几里得范数。
- 在目标函数满足高阶增长假设的条件下,建立关于平稳性度量的收敛速率。
- 为非凸设定下的随机镜像下降、邻近点法及正则化高斯-牛顿方法提供改进的收敛保证。
- 通过利用相对光滑性与凸性假设,消除随机镜像下降中对小批量样本的需求。
- 在相对强凸性与凸模型条件下分析收敛性,获得更快的 $ \widetilde{O}(k^{-1}) $ 收敛速率。
提出的方法
- 用由Legendre函数 $ \Phi $ 生成的Bregman散度 $ D_{\Phi}(y,x) $ 替代标准随机算法中的二次邻近项。
- 假设随机单边模型满足 $ \mathbb{E}[f_x(y,\xi) - f(y)] \leq \frac{\tau}{2} D_\Phi(y,x) $ 与 $ f_x(x,\xi) - f_x(y,\xi) \leq L(\xi) \|x-y\|_2 $,以控制近似误差与变化量。
- 通过Bregman包络 $ F^\Phi_\lambda(x) = \inf_y \{ F(y) + \frac{1}{\lambda} D_\Phi(y,x) \} $ 分析收敛性,其中平稳性通过 $ \| \nabla F^\Phi_\lambda(x) \|_{\Phi} $ 衡量。
- 提出一种新颖的基于Bregman的分析方法,在高阶增长条件下推导收敛速率,包括在平稳性度量下为 $ O(k^{-1/4}) $,在凸性假设下函数值收敛速率为 $ O(k^{-1/2}) $。
- 通过构建适当的模型与Bregman势函数,将该框架应用于随机镜像下降、正则化高斯-牛顿法及鞍点问题。
- 设计一种针对多项式增长目标的Legendre函数 $ \Phi $,使得收敛保证在非Lipschitz设定下依然成立。
实验结果
研究问题
- RQ1在不依赖全局Lipschitz连续性的情况下,随机模型优化能否实现收敛?
- RQ2当近似误差使用Bregman散度而非范数度量时,可实现何种收敛速率?
- RQ3高阶增长条件如何影响随机模型优化方案的收敛性?
- RQ4所提出的框架能否在不使用小批量样本的情况下提升随机镜像下降的收敛速率?
- RQ5在相对光滑性条件下,随机正则化高斯-牛顿法与鞍点算法的收敛保证是什么?
主要发现
- 在高阶增长与基于Bregman的近似假设下,该算法使Bregman包络的梯度以 $ O(k^{-1/4}) $ 的速率趋近于零。
- 当模型为凸时,期望函数值以 $ O(k^{-1/2}) $ 的速率收敛。
- 当正则化项相对于 $ \Phi $ 为 $ \mu $-强凸时,收敛速率提升至 $ \widetilde{O}(k^{-1}) $。
- 该框架可应用于无需梯度小批量的随机镜像下降,优于以往工作。
- 为多项式增长目标显式构造了Legendre函数 $ \Phi $,使得收敛结果成立。
- 通过适当的模型构造,该分析可推广至随机邻近点法、正则化高斯-牛顿法及鞍点算法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。