[论文解读] Stochastic Mirror Descent: Convergence Analysis and Adaptive Variants via the Mirror Stochastic Polyak Stepsize
本文提出了镜像随机Polyak步长(mSPS),一种用于随机镜像下降(SMD)的自适应步长,可在无需有界梯度或方差假设的前提下实现插值条件下的收敛。该工作首次为插值条件下指数梯度方法提供了收敛性保证,并在光滑与相对光滑设置下,为使用常数步长和自适应步长的SMD提供了新收敛结果。
We investigate the convergence of stochastic mirror descent (SMD) under interpolation in relatively smooth and smooth convex optimization. In relatively smooth convex optimization we provide new convergence guarantees for SMD with a constant stepsize. For smooth convex optimization we propose a new adaptive stepsize scheme -- the mirror stochastic Polyak stepsize (mSPS). Notably, our convergence results in both settings do not make bounded gradient assumptions or bounded variance assumptions, and we show convergence to a neighborhood that vanishes under interpolation. Consequently, these results correspond to the first convergence guarantees under interpolation for the exponentiated gradient algorithm for fixed or adaptive stepsizes. mSPS generalizes the recently proposed stochastic Polyak stepsize (SPS) (Loizou et al. 2021) to mirror descent and remains both practical and efficient for modern machine learning applications while inheriting the benefits of mirror descent. We complement our results with experiments across various supervised learning tasks and different instances of SMD, demonstrating the effectiveness of mSPS.
研究动机与目标
- 解决在插值条件下随机镜像下降(SMD)缺乏收敛性保证的问题,特别是针对非欧几里得设置。
- 克服现有SMD方法依赖于有界梯度或方差假设的局限性。
- 设计一种自适应步长方案,将随机Polyak步长(SPS)推广至镜像下降,同时保持实用性与高效性。
- 在相对光滑与光滑设置下,为SMD提供收敛性分析,实现在插值条件下的精确收敛。
- 在包括逻辑回归、核方法以及使用p-范数的深度学习在内的多种机器学习任务中,验证mSPS的有效性。
提出的方法
- 提出镜像随机Polyak步长(mSPS),一种用于SMD的自适应步长,其根据当前迭代点和目标函数值动态调整。
- 引入受限有限最优目标差值(σ²_X),作为比标准σ²更弱的噪声假设,专为约束优化与插值问题设计。
- 通过引入Bregman散度与非欧几里得投影,将随机Polyak步长(SPS)框架适配至镜像下降。
- 在新引入的σ²_X假设下,建立相对光滑设置下使用常数步长的SMD收敛性保证。
- 证明在光滑设置下mSPS的收敛性,且在插值条件下可实现对最优解的精确收敛,无需有界梯度或方差假设。
- 在镜像下降中采用基于Bregman散度的更新,使优化几何结构与问题结构对齐,从而在高维或非欧几里得设置下提升收敛速率。
实验结果
研究问题
- RQ1在无需有界梯度或方差假设的前提下,随机镜像下降能否在插值条件下实现收敛?
- RQ2如何将随机Polyak步长(SPS)推广至镜像下降,以实现自适应、几何感知的优化?
- RQ3受限有限最优目标差值(σ²_X)对相对光滑优化中的收敛性保证有何影响?
- RQ4所提出的mSPS自适应步长是否在多种机器学习任务与镜像下降变体中均优于手工调优的常数步长?
- RQ5在光滑与相对光滑设置下,mSPS能否在插值条件下确保对最小化器的精确收敛?
主要发现
- 本文首次为插值条件下指数梯度算法的收敛性提供了保证,该成果通过mSPS自适应步长实现。
- 在光滑凸优化中,mSPS在无需有界梯度或方差假设的前提下,可实现对最优解的精确收敛。
- 引入受限有限最优目标差值(σ²_X)作为比σ²更弱的噪声假设,使在约束插值设置下实现收敛成为可能。
- 在实验中,mSPS在逻辑回归、核方法以及在CIFAR10上使用ResNet-34的深度学习任务中,表现优于或匹配最佳调优的常数步长。
- 在使用p-范数的深度学习中,当c=0.2且采用平滑处理时,mSPS的收敛速度显著快于常数步长,且随着p减小,优势更加明显。
- mSPS在不同镜像下降变体与问题几何结构下均表现出鲁棒性,即使在固定c=1且无需超参数调优的情况下,也展现出优异性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。