Skip to main content
QUICK REVIEW

[论文解读] Fast gradient descent method for convex optimization problems with an oracle that generates a $(\delta,L)$-model of a function in a requested point

Alexander Tyurin, Alexander Gasnikov|arXiv (Cornell University)|Nov 7, 2017
Sparse and Compressive Sensing Techniques参考文献 13被引用 6
一句话总结

本文提出了一种基于函数新模型(δ, L)的凸优化统一框架,推广了(δ, L)-oracle概念。该方法提出了一种快速梯度法,可处理辅助子问题的非精确解,将复合、层级、条件梯度和邻近方法统一于单一收敛性分析中,并实现最优迭代复杂度。

ABSTRACT

In this article we propose a new concept of a $(\delta,L)$-model of a function which generalizes the concept of the $(\delta,L)$-oracle (Devolder-Glineur-Nesterov). Using this concept we describe the gradient descent method and the fast gradient descent method and we show that many popular methods (composite optimization methods, level methods, conjugate gradient methods, proximal methods) are special cases of proposed methods in this article.

研究动机与目标

  • 将现有的凸优化一阶方法统一于单一框架之下。
  • 推广(δ, L)-oracle概念,以允许在辅助子问题中使用非精确解。
  • 在(δ, L)-模型框架下,建立梯度法与快速梯度法的收敛性保证。
  • 证明复合、条件梯度和邻近方法是所提框架的特例。
  • 通过函数值精度提出一种实用的非精确子问题解的收敛准则。

提出的方法

  • 在点 y 处提出函数 F(x) 的新(δ, L)-模型,由 Fδ(y) 和 ψδ(x,y) 定义,满足 F(x) − Fδ(y) − ψδ(x,y) ≤ L/2‖x−y‖² + δ。
  • 使用 Bregman 散度 V(x,y) = d(x)−d(y)−⟨∇d(y),x−y⟩ 作为邻近度量,其中 d 为 1-强凸的邻近函数。
  • 开发一种快速梯度法,每轮迭代中最小化模型函数 ψδ(x,xk) + αkV(x,xk),允许使用非精确解。
  • 引入子问题求解的 εδ-精度准则,确保主问题目标函数值达到 εδ-最优。
  • 将该框架应用于推导出与已知最优边界匹配的收敛速率,适用于复合、层级和条件梯度方法。
  • 采用重启技术,在辅助问题具有利普希茨连续梯度时实现线性收敛。

实验结果

研究问题

  • RQ1能否开发一个统一框架,将复合、层级、条件梯度和邻近方法统一于单一模型之下?
  • RQ2如何在保持收敛性和最优迭代复杂度的前提下处理辅助子问题的非精确解?
  • RQ3为确保快速梯度法的收敛性,对模型精度(δ)和曲率(L)的最小要求是什么?
  • RQ4(δ, L)-模型概念能否推广 Devolder–Glineur–Nesterov 提出的(δ, L)-oracle?
  • RQ5子问题解的 εδ-精度与主问题目标函数值精度之间存在何种关系?

主要发现

  • 所提出的快速梯度法在(δ, L)-模型框架下,对 ε-最优解实现了最优迭代复杂度 O(1/ε)。
  • 该框架将复合、层级、条件梯度和邻近方法统一为所提方法的特例。
  • 对辅助子问题采用 εδ-精度求解,可保证主问题目标函数值达到 εδ-最优。
  • 对于可分或具有结构化特性的问题,可通过二分法在每变量 O(ln(1/ε)) 时间内求解辅助子问题。
  • 当辅助问题具有利普希茨连续梯度时,通过重启技术可实现线性收敛。
  • (δ, L)-模型推广了(δ, L)-oracle,使多种优化问题的收敛性分析得以统一。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。