Skip to main content
QUICK REVIEW

[论文解读] Oracle Complexity of Second-Order Methods for Finite-Sum Problems

Yossi Arjevani, Ohad Shamir|arXiv (Cornell University)|Nov 15, 2016
Stochastic Gradient Optimization Techniques被引用 4
一句话总结

本文研究了有限和问题中二阶方法的Oracle复杂度,表明尽管在理论上具有优势,但当单个Hessian矩阵可高效计算时,二阶信息并未改善最坏情况下的收敛速率,相较于一阶方法。关键结果是一个下界证明:在此设定下,二阶方法无法优于一阶方法的迭代复杂度,即使能够访问Hessian信息。

ABSTRACT

Finite-sum optimization problems are ubiquitous in machine learning, and are commonly solved using first-order methods which rely on gradient computations. Recently, there has been growing interest in \emph{second-order} methods, which rely on both gradients and Hessians. In principle, second-order methods can require much fewer iterations than first-order methods, and hold the promise for more efficient algorithms. Although computing and manipulating Hessians is prohibitive for high-dimensional problems in general, the Hessians of individual functions in finite-sum problems can often be efficiently computed, e.g. because they possess a low-rank structure. Can second-order information indeed be used to solve such problems more efficiently? In this paper, we provide evidence that the answer -- perhaps surprisingly -- is negative, at least in terms of worst-case guarantees. However, we also discuss what additional assumptions and algorithmic approaches might potentially circumvent this negative result.

研究动机与目标

  • 确定在单个Hessian矩阵可高效计算的前提下,二阶方法是否能实现优于一阶方法的Oracle复杂度,针对有限和问题。
  • 分析在高维设定下,二阶信息在有限和优化中的基本限制。
  • 在标准的光滑性和强凸性假设下,建立任何使用二阶信息的算法所需Oracle查询次数的下界。
  • 探究是否存在额外的结构假设或算法设计,可能克服负向的复杂度下界。
  • 阐明二阶方法在有限和问题中的理论局限性,尤其与已知最优收敛率的一阶方法进行对比。

提出的方法

  • 作者采用Oracle复杂度框架,建模能够访问有限和中各个分量函数的函数值、梯度和Hessian矩阵的算法。
  • 通过构造一个高维、结构化的优化问题作为困难实例,其中每个分量函数的Hessian矩阵具有低秩结构(例如,秩-1),使得Hessian计算高效。
  • 分析依赖于组合论证,涉及算法查询中非零坐标的数量,追踪每轮迭代中可学习的新坐标数量。
  • 推导出每轮迭代中坐标覆盖范围预期改进的递推关系与求和上界,表明达到$ϵ$-精度所需的迭代次数至少为$Ω(n + √{n\mu/\lambda} \log(1/\epsilon))$。
  • 在包含$n^{d-1}$个元组的集合上使用概率论证,追踪每轮迭代中非零坐标数量的期望增长。
  • 应用Jensen不等式和幂级数恒等式来界定期望改进,最终推导出迭代次数的下界。

实验结果

研究问题

  • RQ1在单个Hessian矩阵可高效计算的前提下,二阶方法是否能实现优于一阶方法的Oracle复杂度,针对有限和问题?
  • RQ2在标准光滑性和强凸性假设下,二阶信息在有限和优化中的基本限制是什么?
  • RQ3从单个分量函数获得Hessian信息是否能在迭代复杂度方面提供可证明的优势?
  • RQ4是否存在结构假设或算法设计,能够规避二阶方法复杂度的负向下界?
  • RQ5在Hessian可处理的高维设定下,二阶方法的复杂度与一阶方法相比如何?

主要发现

  • 即使单个函数的Hessian矩阵可高效计算,二阶方法在有限和问题中最坏情况下的Oracle复杂度仍无法优于一阶方法。
  • 二阶方法的迭代复杂度下界与一阶方法的已知下界一致:$\Omega(n + \sqrt{n\mu/\lambda} \log(1/\epsilon))$。
  • 即使单个Hessian矩阵为低秩(例如,秩-1),该结果依然成立,这使得其计算与存储在高维下高效。
  • 负面结果源于每轮迭代中算法可学习的新坐标数量受限,无论其使用梯度还是Hessian信息。
  • 分析表明,每轮迭代中坐标覆盖范围的期望改进被限制在$2/n$以内,导致最坏情况下总迭代次数为$\Omega(n)$。
  • 作者得出结论:在此设定下,仅靠二阶信息无法突破根本的复杂度障碍,除非引入额外假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。