Skip to main content
QUICK REVIEW

[论文解读] A Note on Inexact Condition for Cubic Regularized Newton's Method

Zhe Wang, Yi Zhou|arXiv (Cornell University)|Aug 22, 2018
Sparse and Compressive Sensing Techniques参考文献 6被引用 5
一句话总结

该论文在仅依赖当前迭代点信息而非未来迭代点的实用不精确性条件下,首次为不精确的立方正则化牛顿法建立了理论收敛保证。它证明该方法达到二阶平稳点的收敛速率与精确方法相同,采用了一种新颖的全局充分下降分析方法,而非逐次迭代的下降分析。

ABSTRACT

This note considers the inexact cubic-regularized Newton's method (CR), which has been shown in \cite{Cartis2011a} to achieve the same order-level convergence rate to a secondary stationary point as the exact CR \citep{Nesterov2006}. However, the inexactness condition in \cite{Cartis2011a} is not implementable due to its dependence on future iterates variable. This note fixes such an issue by proving the same convergence rate for nonconvex optimization under an inexact adaptive condition that depends on only the current iterate. Our proof controls the sufficient decrease of the function value over the total iterations rather than each iteration as used in the previous studies, which can be of independent interest in other contexts.

研究动机与目标

  • 为解决先前工作中不精确性条件不切实际的问题,即其依赖于未来迭代点,因而不可实施。
  • 在仅依赖当前迭代点信息的实用不精确性条件下,建立不精确立方正则化方法的理论收敛性。
  • 证明不精确方法在达到二阶平稳点时,其收敛速率与精确方法相同。
  • 提出一种基于控制所有迭代中总函数值下降量的新型分析技术,而非依赖于逐次迭代的下降。

提出的方法

  • 提出一种新的 Hessian 不精确性条件:\|H_k - \nabla^2 f(x_k)\| \leq C \|s_k\|,该条件仅依赖于当前迭代点,具有实际可实施性。
  • 为梯度引入类似的不精确性条件:\|g_k - \nabla f(x_k)\| \leq \alpha \|s_k\|。
  • 采用一种全局分析框架,追踪所有迭代中目标函数的总充分下降量,而非要求每一步都实现下降。
  • 应用 Weyl 不等式和 Hessian 的利普希茨连续性,以界定 Hessian 近似矩阵的最小特征值。
  • 推导出所有迭代中 \|s_i\|^3 之和的上界,从而支持收敛速率分析。
  • 通过证明 \|\nabla f(x)\| 和 \nabla^2 f(x) 的最小特征值以与精确方法相同的速率收敛至零,建立对二阶平稳点的收敛性。

实验结果

研究问题

  • RQ1在仅依赖当前迭代点信息的实用不精确性条件下,不精确立方正则化牛顿法能否实现理论收敛?
  • RQ2在该条件下,不精确方法是否能以与精确方法相同的收敛速率达到二阶平稳点?
  • RQ3能否通过所有迭代的全局充分下降分析,替代不精确方法收敛性证明中标准的逐次迭代下降论证?
  • RQ4所提出的不精确性条件与依赖未来迭代点或固定常数的先前条件相比有何差异?

主要发现

  • 在依赖当前迭代点的不精确性条件 \|H_k - \nabla^2 f(x_k)\| \leq C \|s_k\| 下,不精确立方正则化牛顿法达到二阶平稳点的收敛速率与精确方法处于同一阶次。
  • 该收敛速率通过一种新颖的分析方法实现,该方法控制所有迭代中目标函数的总充分下降量,而非要求每一步都实现充分下降。
  • 该方法保证了 \|\nabla f(x)\| \to 0 且 \nabla^2 f(x) 的最小特征值以 O(1/k^{1/3}) 的速率收敛至零,该速率以步长范数表示。
  • 分析表明,对某个 m,有 \|\nabla f(x_{m+1})\| \leq O(1/(k-1)^{2/3}) 且 \nabla^2 f(x_{m+1}) 的最小特征值 \geq -O(1/(k-1)^{1/3}),证实了与精确方法相同的收敛阶次。
  • 所提条件比先前的固定-epsilon 条件更具自适应性,因其随 \|s_k\| 而缩放,允许在优化早期阶段采用更大的步长。
  • 该证明技术本身具有独立兴趣,因为它通过将前期迭代的误差整合到全局界中,使得在更宽松的不精确性条件下实现收敛性分析成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。