Skip to main content
QUICK REVIEW

[论文解读] Boosting One-Point Derivative-Free Online Optimization via Residual Feedback

Yan Zhang, Yi Zhou|arXiv (Cornell University)|Oct 14, 2020
Advanced Bandit Algorithms Research参考文献 27被引用 7
一句话总结

本文提出了一种新颖的一点无导数在线优化方法,通过残差反馈估计梯度,显著降低了方差。通过利用连续函数评估值之间的差异,该方法在较弱假设下,为凸与非凸问题均实现了更紧的遗憾界,理论与实践上均优于传统的一点方法。

ABSTRACT

Zeroth-order optimization (ZO) typically relies on two-point feedback to estimate the unknown gradient of the objective function. Nevertheless, two-point feedback can not be used for online optimization of time-varying objective functions, where only a single query of the function value is possible at each time step. In this work, we propose a new one-point feedback method for online optimization that estimates the objective function gradient using the residual between two feedback points at consecutive time instants. Moreover, we develop regret bounds for ZO with residual feedback for both convex and nonconvex online optimization problems. Specifically, for both deterministic and stochastic problems and for both Lipschitz and smooth objective functions, we show that using residual feedback can produce gradient estimates with much smaller variance compared to conventional one-point feedback methods. As a result, our regret bounds are much tighter compared to existing regret bounds for ZO with conventional one-point feedback, which suggests that ZO with residual feedback can better track the optimizer of online optimization problems. Additionally, our regret bounds rely on weaker assumptions than those used in conventional one-point feedback methods. Numerical experiments show that ZO with residual feedback significantly outperforms existing one-point feedback methods also in practice.

研究动机与目标

  • 解决传统一点反馈在在线优化中的局限性,即每时间步仅允许一次函数评估。
  • 克服标准一点梯度估计器方差过高的问题,该问题会降低在线与非平稳环境下的性能。
  • 在弱于先前工作的假设下,为零阶在线优化建立更紧的遗憾界。
  • 实现在对抗性与非平稳环境中对时变最优解的高效追踪。
  • 提供对非凸在线优化问题中一点 ZO 方法的首次理论分析。

提出的方法

  • 提出一种新型梯度估计器,利用两个连续反馈点之间的残差:$ \widetilde{g}_t^{\text{res}} = \frac{u_t}{\delta} \left( f_t(x_t + \delta u_t) - f_{t-1}(x_{t-1} + \delta u_{t-1}) \right) $。
  • 利用此残差反馈在每时间步仅允许一次函数查询的在线环境中估计梯度。
  • 通过在利普希茨连续与光滑性假设下分析梯度估计器的二阶矩,建立理论遗憾界。
  • 推导确定性与随机环境下的遗憾界,表明由于方差降低,收敛速率得到提升。
  • 使用 $ \alpha = \frac{4dL_0^2\eta^2}{\delta^2} $ 的递归期望界,控制梯度范数方差随时间的增长。
  • 引入假设 I.3,以有界总变差建模时变目标函数,从而在非平稳条件下实现分析。

实验结果

研究问题

  • RQ1能否改进一点反馈以降低在线零阶优化中梯度估计的方差?
  • RQ2连续时间步之间的残差反馈是否能优于标准一点反馈,获得更优的遗憾界?
  • RQ3所提方法是否在弱于现有方法的假设下,实现更紧的遗憾界?
  • RQ4该方法能否在非平稳、对抗性环境中有效追踪时变最优解?
  • RQ5所提残差反馈方法是否在非凸在线优化问题中具有理论依据?

主要发现

  • 所提残差反馈方法产生的梯度估计方差显著低于传统一点反馈。
  • 凸与非凸问题的遗憾界均比现有的一点 ZO 方法更紧,尤其在目标函数值较大时表现更优。
  • 理论分析基于更弱的假设,如目标函数值的总变差有界,而非函数值的统一上界。
  • 数值实验表明,采用残差反馈的 ZO 方法在追踪时变最优解方面优于传统的一点方法。
  • 本文首次为非凸在线优化中的一点零阶方法提供了理论遗憾分析。
  • 梯度估计器的二阶矩被有界于 $ \frac{1}{1 - \alpha} \left( 16L_0^2(d+4)^2 + \frac{2d}{\delta^2}V_f^2 \right) $,确保了稳定性与收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。