Skip to main content
QUICK REVIEW

[论文解读] Optimal rates for zero-order convex optimization: the power of two function evaluations

John C. Duchi, Michael I. Jordan|arXiv (Cornell University)|Dec 7, 2013
Stochastic Gradient Optimization Techniques参考文献 38被引用 6
一句话总结

本文在每次迭代中仅使用两次函数评估的情况下,建立了零阶凸优化的最优收敛速率。研究证明,通过随机扰动进行梯度估计,其收敛速率最差仅比一阶方法差√d因子,并提出了实现这些速率的简单算法,且通过紧致的信息论下界得到验证。

ABSTRACT

We consider derivative-free algorithms for stochastic and non-stochastic convex optimization problems that use only function values rather than gradients. Focusing on non-asymptotic bounds on convergence rates, we show that if pairs of function values are available, algorithms for $d$-dimensional optimization that use gradient estimates based on random perturbations suffer a factor of at most $\sqrt{d}$ in convergence rate over traditional stochastic gradient methods. We establish such results for both smooth and non-smooth cases, sharpening previous analyses that suggested a worse dimension dependence, and extend our results to the case of multiple ($m \ge 2$) evaluations. We complement our algorithmic development with information-theoretic lower bounds on the minimax convergence rate of such problems, establishing the sharpness of our achievable results up to constant (sometimes logarithmic) factors.

研究动机与目标

  • 为解决仅能访问函数值的零阶优化收敛速率理解上的差距。
  • 分析在d维凸优化中,每次迭代使用两次函数评估对收敛速度的影响。
  • 基于随机扰动梯度估计,开发简单而高效的算法,以实现最优收敛速率。
  • 建立紧致的信息论下界,以确认所提算法的最优性。

提出的方法

  • 提出一种随机梯度估计器,利用在θ和θ + uZ处的成对函数评估,其中Z ∈ ℝ^d为随机向量。
  • 使用带估计梯度的随机镜像下降和随机梯度下降,以最小化目标函数f(θ) = ℰ[F(θ;X)]。
  • 推导在双评估模型下,光滑与非光滑凸函数的收敛速率。
  • 应用信息论技术,包括KL散度和Pinsker不等式,推导优化误差的极小极大下界。
  • 利用球面设计和对称性论证,界定梯度估计器期望范数的上界。
  • 建立随机优势与集中不等式,以控制梯度估计器的方差。

实验结果

研究问题

  • RQ1在每次迭代中仅有两次函数评估的情况下,d维零阶凸优化可实现的最优收敛速率是什么?
  • RQ2与单次评估方案相比,使用两次函数评估如何影响收敛速率的维数依赖性?
  • RQ3是否能通过简单、随机化的算法,在常数或对数因子范围内实现最优速率?
  • RQ4在此设置下,极小极大优化误差的最紧致信息论下界是什么?
  • RQ5维度d如何影响零阶优化中可实现速率与下界之间的差距?

主要发现

  • 两次评估的零阶优化收敛速率与一阶方法相比,最差仅损失√d因子,且该结果在对数因子范围内为最优。
  • 对于光滑凸函数,所提算法在k次迭代后达到𝒪(√d / √k)的收敛速率,与下界在常数因子内一致。
  • 对于非光滑凸函数,算法在k次迭代后达到𝒪(√d / k^{1/4})的收敛速率,同样与下界在对数因子范围内一致。
  • 极小极大优化误差的信息论下界为:光滑函数情形下为Ω(√d / k^{1/2}),非光滑函数情形下为Ω(√d / k^{1/4})。
  • 该分析纠正了早期会议版本中的错误,并通过KL散度和Pinsker不等式,提出了新的、更具鲁棒性的下界论证。
  • 结果可推广至m ≥ 2次函数评估的情形,表明在高维中,多次评估可进一步提升收敛速率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。