Skip to main content
QUICK REVIEW

[论文解读] A Stochastic Trust Region Method for Non-convex Minimization

Zebang Shen, Pan Zhou|arXiv (Cornell University)|Mar 4, 2019
Stochastic Gradient Optimization Techniques参考文献 18被引用 8
一句话总结

该论文提出了一种样本高效的随机信赖域(STR)算法,用于非凸有限和最小化问题,通过一种新颖的Hessian估计器以及不精确的梯度/Hessian近似,实现了$Ø(√n/ϵ^{1.5})$的随机Hessian oracle复杂度,相较于先前工作提升了$Ø(n^{1/6})$。该方法实现了$Ø(1/k^{2/3})$的收敛速率,并以更低的计算成本找到$(ϵ,\sqrt{ϵ})$-近似二阶平稳点。

ABSTRACT

We target the problem of finding a local minimum in non-convex finite-sum minimization. Towards this goal, we first prove that the trust region method with inexact gradient and Hessian estimation can achieve a convergence rate of order $\mathcal{O}(1/{k^{2/3}})$ as long as those differential estimations are sufficiently accurate. Combining such result with a novel Hessian estimator, we propose the sample-efficient stochastic trust region (STR) algorithm which finds an $(ε, \sqrtε)$-approximate local minimum within $\mathcal{O}({\sqrt{n}}/{ε^{1.5}})$ stochastic Hessian oracle queries. This improves state-of-the-art result by $\mathcal{O}(n^{1/6})$. Experiments verify theoretical conclusions and the efficiency of STR.

研究动机与目标

  • 开发一种随机信赖域方法,以高效地在非凸有限和最小化问题中找到$(\epsilon,\sqrt{\epsilon})$-近似二阶平稳点。
  • 相较于现有的四次正则化和信赖域方法,降低随机Hessian oracle复杂度,特别是在大规模设置下。
  • 通过将不精确的梯度和Hessian估计与信赖域框架相结合,实现改进的收敛速率。
  • 设计一种新型Hessian估计器,以在较低的摊销oracle成本下保持高精度。
  • 以反映实际计算权衡的方式,平衡一阶与二阶oracle复杂度。

提出的方法

  • 该方法采用信赖域框架,通过二阶泰勒展开近似目标函数,并在局部区域内强制执行步长。
  • 提出一种新型Hessian估计器,可在减少随机Hessian oracle查询次数的同时保持高精度,从而实现更低的整体复杂度。
  • 使用不精确的梯度和Hessian估计,且在估计足够精确的条件下证明了收敛性,实现了$Ø(1/k^{2/3})$的全局收敛速率。
  • 提出两种变体:STR1通过新型Hessian估计器和现有梯度估计器优先提升Hessian oracle效率;STR2通过集成梯度与Hessian估计,平衡一阶与二阶复杂度。
  • 子问题通过在与Hessian相关的Krylov子空间中使用Lanczos方法近似求解。
  • 该算法针对问题的有限和结构进行了定制,以最小化完整梯度和Hessian的计算。

实验结果

研究问题

  • RQ1随机信赖域方法能否在非凸有限和问题中实现比现有四次正则化和信赖域方法更优的随机Hessian oracle复杂度?
  • RQ2新型Hessian估计器能否在保持收敛保证的同时降低Hessian近似的摊销成本?
  • RQ3在实践中,平衡一阶与二阶oracle复杂度是否能带来更快的整体收敛速度?
  • RQ4在足够精确的估计条件下,不精确的梯度与Hessian估计是否仍能实现$Ø(1/k^{2/3})$的收敛速率?
  • RQ5与SVRC和Lite-SVRC等最先进方法相比,所提出的STR算法在Hessian查询方面是否更具样本效率?

主要发现

  • 所提出的STR算法实现了$Ø(√n/ϵ^{1.5})$的随机Hessian oracle复杂度,相较于现有最佳结果$Ø(n^{2/3}/ϵ^{1.5})$提升了$Ø(n^{1/6})$的因子。
  • STR1实现了$Ø(√n/ϵ^{1.5})$的Hessian oracle复杂度,低于先前方法,且在$ϵ$依赖性上与理论下界一致。
  • STR2实现了整体随机一阶与二阶oracle复杂度$Ø(n^{3/4}/ϵ^{1.5})$,优于现有最佳结果$Ø(n^{4/5}/ϵ^{1.5})$。
  • 理论分析证实,当估计足够精确时,采用不精确梯度与Hessian估计的信赖域方法可实现$Ø(1/k^{2/3})$的收敛速率。
  • 在逻辑回归与非线性最小二乘问题上的实验表明,STR在运行时间与Hessian样本复杂度方面均快于TR、ARC、SCR、SVRC与Lite-SVRC。
  • STR的收敛曲线在Hessian样本复杂度方面更为陡峭,证实了其在Hessian查询效率上的理论优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。