Skip to main content
QUICK REVIEW

[论文解读] A Stochastic Derivative Free Optimization Method with Momentum

Eduard Gorbunov, Adel Bibi|arXiv (Cornell University)|May 30, 2019
Stochastic Gradient Optimization Techniques参考文献 46被引用 7
一句话总结

本文提出SMTP,一种基于随机搜索方向与仅函数评估的无导数优化方法,引入了动量加速机制,适用于无约束光滑优化问题。该方法在非凸、凸及强凸设置下,相较于STP及其他先进无导数优化(DFO)方法,实现了更优的收敛速率,具备理论复杂度边界,并在MuJoCo环境下的连续控制任务中展现出优异的实验性能。

ABSTRACT

We consider the problem of unconstrained minimization of a smooth objective function in $\mathbb{R}^d$ in setting where only function evaluations are possible. We propose and analyze stochastic zeroth-order method with heavy ball momentum. In particular, we propose, SMTP, a momentum version of the stochastic three-point method (STP) \cite{Bergou_2018}. We show new complexity results for non-convex, convex and strongly convex functions. We test our method on a collection of learning to continuous control tasks on several MuJoCo \cite{Todorov_2012} environments with varying difficulty and compare against STP, other state-of-the-art derivative-free optimization algorithms and against policy gradient methods. SMTP significantly outperforms STP and all other methods that we considered in our numerical experiments. Our second contribution is SMTP with importance sampling which we call SMTP_IS. We provide convergence analysis of this method for non-convex, convex and strongly convex objectives.

研究动机与目标

  • 开发一种基于动量的随机零阶优化方法,适用于仅能获取函数评估值而无梯度信息的无导数优化场景。
  • 为非凸、凸及强凸目标函数建立全局收敛性,并获得改进的复杂度边界。
  • 设计一种重要性采样变体SMTP_IS,以进一步提升收敛效率。
  • 通过实验验证SMTP在连续控制任务中优于STP、其他DFO算法及策略梯度方法的性能。

提出的方法

  • 提出SMTP,即Stochastic Three-Point(STP)方法的动量增强版本,通过随机搜索方向与在三点x_k、x_k + α_k s_k、x_k - α_k s_k处的函数评估实现优化。
  • 引入Heavy Ball动量机制,通过利用历史迭代信息加速收敛,其思想类似于Polyak动量,但针对零阶优化场景进行了适配。
  • 采用随机三重点更新规则:x_{k+1} = argmin{f(x_k), f(x_k + α_k s_k), f(x_k - α_k s_k)}。
  • 提出SMTP_IS,一种在坐标方向上采用非均匀重要性采样(采样概率与局部光滑性L_i成正比)的变体。
  • 基于通用框架与假设3.1,确保梯度与搜索方向之间期望内积有界。
  • 在L-光滑性假设下分析收敛性,并基于函数评估次数推导出不同问题类别的复杂度边界。

实验结果

研究问题

  • RQ1能否在无导数优化中有效引入动量机制,以在无梯度信息条件下加速收敛?
  • RQ2基于动量的零阶方法在非凸、凸及强凸函数下的理论收敛速率如何?
  • RQ3在坐标方向上采用重要性采样如何提升无导数方法的收敛性能?
  • RQ4所提方法是否在实际强化学习基准测试中优于STP及其他先进DFO算法?

主要发现

  • SMTP在非凸问题中达到O(1/ε²)的复杂度,与零阶方法的最佳已知速率一致。
  • 在凸目标下,SMTP实现O(1/ε)的复杂度,该结果在给定假设下对零阶方法而言为最优。
  • 在强凸情形下,SMTP实现O(log(1/ε))的复杂度,表明其具有对数收敛速率。
  • SMTP_IS通过与条件数及坐标方向光滑性相关的因子,实现优于SMTP的复杂度,且在高维设置下常数项更优。
  • 实验结果表明,SMTP在MuJoCo连续控制任务中显著优于STP、其他DFO方法及策略梯度基线方法。
  • 该方法在不同任务难度下均表现出鲁棒性与高效性,验证了动量与重要性采样在实际应用中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。