[论文解读] Regret minimization in stochastic non-convex learning via a proximal-gradient approach
本文提出了一种基于一阶Oracle反馈的近端-梯度方法,用于在约束和正则化条件下进行随机非凸优化,实现了无局部遗憾。该方法建立了极小-极大顺序最优的遗憾界,并通过一种具有复杂度保证的新近端-梯度方案,将在线与离线非凸随机优化联系起来,其复杂度与方差减少技术相匹配。
Motivated by applications in machine learning and operations research, we study regret minimization with stochastic first-order oracle feedback in online constrained, and possibly non-smooth, non-convex problems. In this setting, the minimization of external regret is beyond reach for first-order methods, so we focus on a local regret measure defined via a proximal-gradient mapping. To achieve no (local) regret in this setting, we develop a prox-grad method based on stochastic first-order feedback, and a simpler method for when access to a perfect first-order oracle is possible. Both methods are min-max order-optimal, and we also establish a bound on the number of prox-grad queries these methods require. As an important application of our results, we also obtain a link between online and offline non-convex stochastic optimization manifested as a new prox-grad scheme with complexity guarantees matching those obtained via variance reduction techniques.
研究动机与目标
- 解决在具有随机一阶Oracle反馈的在线、约束、非光滑和非凸优化中遗憾最小化的挑战。
- 在该设置下开发一种近端-梯度算法,通过近端-梯度映射实现无局部遗憾。
- 在随机反馈和约束条件下,建立所提方法的极小-极大顺序最优性。
- 推导出所需随机一阶Oracle(SFO)查询次数的复杂度界。
- 通过具有匹配复杂度保证的近端-梯度方案,建立在线与离线非凸随机优化之间的新联系。
提出的方法
- 本文提出一种基于随机一阶反馈的近端-梯度方法,使用大小为 $ w $ 的滑动窗口来定义局部遗憾度量。
- 引入近端-梯度映射以处理非光滑性和约束,对内层迭代应用下降引理。
- 在内层循环中基于梯度和步长条件设置停止准则,确保目标函数值充分下降。
- 在Lipschitz光滑性、梯度有界性和随机梯度方差有界的假设下进行分析。
- 关键组成部分是使用滑动窗口平均 $ S_{t,w}({f x}) $ 来定义局部遗憾比较器,从而实现对局部最优性的跟踪。
- 通过Young不等式和下降引理推导理论界,得到近端梯度期望平方范数的上界。
实验结果
研究问题
- RQ1在具有随机一阶反馈的在线、约束、非光滑和非凸优化中,能否实现无局部遗憾?
- RQ2所提出的近端-梯度方法在遗憾和SFO查询复杂度方面是否为极小-极大顺序最优?
- RQ3能否将在线局部遗憾框架与具有可比复杂度保证的离线非凸随机优化联系起来?
- RQ4为实现 $ ilde{O}( au) $ 复杂度($ au $ 为迭代次数),所需随机一阶Oracle调用次数是多少?
- RQ5在随机设置下,该方法在有界方差和Lipschitz光滑性假设下的表现如何?
主要发现
- 所提近端-梯度方法实现了局部遗憾界 $ Oig(( au^2 + au)/w^2ig) $,该界为极小-极大顺序最优。
- 近端梯度期望平方范数被界为 $ rac{2}{(T-w)w^2}ig(( au^2 + au)T + 6V_w[T]ig) $,确保收敛至驻点。
- 随机一阶Oracle(SFO)调用次数被界为 $ O(M au ho^{-3/2}) $,其中 $ ho $ 为期望精度,$ M $ 为问题参数。
- 该方法实现了与离线非凸随机优化中方差减少技术相匹配的复杂度保证。
- SFO调用次数的界通过内层循环的下降论证得出,表明每轮外迭代需 $ O(w) $ 次调用。
- 分析表明,该方法对随机梯度具有鲁棒性,并在较弱正则性条件下保持次线性遗憾。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。