Skip to main content
QUICK REVIEW

[论文解读] A Stochastic Extra-Step Quasi-Newton Method for Nonsmooth Nonconvex Optimization

Minghan Yang, Andre Milzarek|arXiv (Cornell University)|Oct 21, 2019
Sparse and Compressive Sensing Techniques参考文献 122被引用 6
一句话总结

该论文提出了一种用于非光滑非凸优化的随机额外步拟牛顿方法,通过结合随机高阶步骤与额外的近端梯度步骤,确保在期望下全局收敛至驻点。该方法在寻找 $\varepsilon$-精确驻点时,实现了 $\mathcal{O}(N^{2/3}/\varepsilon)$ 的增量一阶预言机复杂度,优于一阶方法,在大规模逻辑回归和深度学习任务中表现更优。

ABSTRACT

In this paper, a novel stochastic extra-step quasi-Newton method is developed to solve a class of nonsmooth nonconvex composite optimization problems. We assume that the gradient of the smooth part of the objective function can only be approximated by stochastic oracles. The proposed method combines general stochastic higher order steps derived from an underlying proximal type fixed-point equation with additional stochastic proximal gradient steps to guarantee convergence. Based on suitable bounds on the step sizes, we establish global convergence to stationary points in expectation and an extension of the approach using variance reduction techniques is discussed. Motivated by large-scale and big data applications, we investigate a stochastic coordinate-type quasi-Newton scheme that allows to generate cheap and tractable stochastic higher order directions. Finally, the proposed algorithm is tested on large-scale logistic regression and deep learning problems and it is shown that it compares favorably with other state-of-the-art methods.

研究动机与目标

  • 解决由于计算成本过高而无法进行完整梯度计算的大规模、大数据优化问题。
  • 开发一种结合高阶信息的随机拟牛顿方法,同时在随机逼近下确保全局收敛。
  • 设计一种避免昂贵线搜索的方案,通过引入额外的近端梯度步骤来稳定收敛。
  • 通过利用随机高阶方向,实现相比一阶方法更优的收敛复杂度。
  • 在稀疏逻辑回归和深度学习等实际问题上验证该方法的有效性。

提出的方法

  • 该方法求解形如 $\min_x f(x) + \varphi(x)$ 的复合非凸问题,其中 $f$ 是光滑的,但仅可通过随机预言机访问。
  • 通过近端型不动点方程 $F^\Lambda(x) = x - \mathrm{prox}^\Lambda_\varphi(x - \Lambda^{-1}\nabla f(x)) = 0$ 定义最优性条件。
  • 通过使用来自随机预言机的近似梯度求解该不动点方程,推导出随机高阶步骤。
  • 引入额外的随机近端梯度步骤,以确保全局收敛并稳定迭代序列。
  • 算法采用满足特定可 summability 条件的步长规则,以平衡随机误差与收敛性。
  • 将方差减少技术和子采样方案整合到框架中,以提升效率与稳定性。

实验结果

研究问题

  • RQ1在仅能访问随机梯度的条件下,结合高阶步骤的随机拟牛顿方法是否能在非光滑非凸设置下实现全局收敛?
  • RQ2如何通过额外的近端梯度步骤在不依赖线搜索或回溯的情况下稳定收敛?
  • RQ3此类方法的增量一阶预言机(IFO)复杂度是多少?与一阶方法相比如何?
  • RQ4该方法能否通过坐标型更新高效实现于大规模问题?
  • RQ5引入随机高阶信息是否能提升在深度学习和稀疏逻辑回归任务中的性能?

主要发现

  • 所提方法在期望下实现全局收敛至驻点,满足 $\mathbb{E}[\|F^I(\mathbf{X}^k)\|^2] \to 0$ 当 $k \to \infty$。
  • 达到 $\varepsilon$-精确驻点的 IFO 复杂度为 $\mathcal{O}(N^{2/3}/\varepsilon)$,优于标准一阶方法。
  • 该方法在大规模逻辑回归和深度学习基准测试中,性能与当前最先进的 1 阶方法相当。
  • 结合方差减少技术与随机高阶方向,可实现更快收敛与更强鲁棒性。
  • 坐标型拟牛顿方案可生成廉价且可计算的搜索方向,适用于大规模问题。
  • 理论分析证实,额外步骤可在无需线搜索的情况下实现目标函数值的近似下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。