[论文解读] The Power of First-Order Smooth Optimization for Black-Box Non-Smooth Problems
本文提出了一种基于通用平滑的框架,使一阶光滑优化方法能够以最优的预言机复杂度和近似最优的迭代复杂度求解黑箱非光滑凸问题。通过利用随机平滑和批量并行的零阶预言机查询,该方法实现了 $ O(d^{1/4} M_2 R / \varepsilon) $ 次迭代,每次迭代仅需 $ O(d^{3/4} M_2 R / \varepsilon) $ 次预言机调用,与非光滑设置下迭代复杂度的理论下界完全一致。
Gradient-free/zeroth-order methods for black-box convex optimization have been extensively studied in the last decade with the main focus on oracle calls complexity. In this paper, besides the oracle complexity, we focus also on iteration complexity, and propose a generic approach that, based on optimal first-order methods, allows to obtain in a black-box fashion new zeroth-order algorithms for non-smooth convex optimization problems. Our approach not only leads to optimal oracle complexity, but also allows to obtain iteration complexity similar to first-order methods, which, in turn, allows to exploit parallel computations to accelerate the convergence of our algorithms. We also elaborate on extensions for stochastic optimization problems, saddle-point problems, and distributed optimization.
研究动机与目标
- 解决尽管在非光滑凸优化中已实现最优预言机复杂度,但零阶方法在迭代复杂度方面仍存在差距的问题。
- 开发一种黑箱方法,仅通过函数值查询即可利用一阶光滑优化技术求解非光滑问题。
- 通过最小化每次迭代的预言机调用次数,实现并行计算,同时保持最优的总预言机复杂度。
- 将该框架扩展至随机优化、鞍点问题和分布式优化场景。
- 在强化学习和回归任务中,展示该方法在实际性能上与基于梯度的方法具有竞争力。
提出的方法
- 提出一种随机平滑方案,其中 $ f_\gamma(x) = \mathbb{E}_u[f(x+u)] $,且 $ u \sim \text{Unif}(B^d_2(\gamma)) $,将非光滑函数 $ f $ 转换为光滑近似。
- 将光滑近似 $ f_\gamma $ 作为 $ f $ 的代理,从而可应用具有已知收敛保证的最优一阶方法。
- 设计批量并行的零阶算法,每次迭代在多个点上查询 $ f $,在保持总预言机复杂度最优的同时最小化每次迭代的预言机成本。
- 通过批量处理、重启和一致性投影技术,将该框架应用于随机、鞍点和分布式问题,实现复杂度边界的保持。
- 在算法设计中引入非欧几里得几何,以提升收敛速度并适应问题结构。
- 采用不精确的梯度近似(中心差分和前向差分)仅通过函数评估来近似 $ \nabla f_\gamma $。
实验结果
研究问题
- RQ1是否可以通过零阶预言机,以最优的预言机复杂度和迭代复杂度,将一阶光滑优化方法适配于非光滑黑箱问题?
- RQ2在零阶非光滑优化中,是否可能在不牺牲最优预言机复杂度的前提下实现近似最优的迭代复杂度?
- RQ3平滑半径 $ \gamma $ 的选择以及几何结构(如欧几里得与非欧几里得)如何影响零阶方法的收敛速度和稳定性?
- RQ4该提出的框架是否可扩展至随机优化、鞍点问题和分布式优化问题,同时保持复杂度边界?
- RQ5基于该方案的零阶方法在实际强化学习和回归任务中,与基于梯度的方法相比性能如何?
主要发现
- 所提方法实现了 $ O(d^{1/4} M_2 R / \varepsilon) $ 的迭代复杂度,与非光滑零阶问题的理论下界 $ \min\{d^{1/4} \varepsilon^{-1}, d^{1/3} \varepsilon^{-2/3}\} $ 完全一致。
- 每次迭代仅需 $ O(d^{3/4} M_2 R / \varepsilon) $ 次预言机调用,该代价为每次迭代的最优值,支持高效的并行化。
- 总预言机调用次数为最优,与已知的零阶非光滑凸优化的理论下界一致。
- 在 Reacher-v2、abalone 和 a9a 数据集上的实验结果表明,ADAM 配合零阶梯度(中心差分/前向差分)的性能几乎与使用精确梯度相当,尤其在 $ \gamma $ 选择得当时表现更佳。
- 由于点间分离距离更大,中心差分在数值误差下比前向差分更具鲁棒性,验证了理论预期。
- 通过批量处理、重启和一致性投影等标准技术,该框架可扩展至随机、鞍点和分布式场景,同时保持复杂度边界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。