Skip to main content
QUICK REVIEW

[论文解读] Inexact Tensor Methods with Dynamic Accuracies

Nikita Doikov, Yurii Nesterov|arXiv (Cornell University)|Feb 21, 2020
Stochastic Gradient Optimization Techniques参考文献 42被引用 6
一句话总结

本文提出了一种用于复合目标函数凸优化的动态不精确张量方法,采用基于残差的精度准则,其精度随迭代过程自适应降低。该方法建立了与精确情况相匹配的全局收敛速率,并为高阶方法提供了局部超线性收敛速率,且在机器学习问题上的复杂度边界通过数值实验得到验证。

ABSTRACT

In this paper, we study inexact high-order Tensor Methods for solving convex optimization problems with composite objective. At every step of such methods, we use approximate solution of the auxiliary problem, defined by the bound for the residual in function value. We propose two dynamic strategies for choosing the inner accuracy: the first one is decreasing as $1/k^{p + 1}$, where $p \geq 1$ is the order of the method and $k$ is the iteration counter, and the second approach is using for the inner accuracy the last progress in the target objective. We show that inexact Tensor Methods with these strategies achieve the same global convergence rate as in the error-free case. For the second approach we also establish local superlinear rates (for $p \geq 2$), and propose the accelerated scheme. Lastly, we present computational results on a variety of machine learning problems for several methods and different accuracy policies.

研究动机与目标

  • 为降低高阶优化的计算成本,允许子问题解不精确,同时不牺牲收敛速度。
  • 为不精确张量方法开发动态精度策略,根据目标函数的进展自适应调整精度。
  • 建立与精确情况相匹配的全局收敛速率,并为强凸问题中的高阶方法提供局部超线性收敛速率。
  • 为基于函数值残差精度的不精确张量方法提供复杂度保证与加速方案。
  • 在不同精度策略下,通过实验验证所提方法在机器学习问题上的性能。

提出的方法

  • 提出两种动态精度规则:$\delta_k := 1/k^{p+1}$ 与 $\delta_k := c \cdot (F(x_{k-2}) - F(x_{k-1}))$,其中 $p \geq 1$ 为方法阶数,$c \geq 0$ 为常数。
  • 采用函数值残差作为子问题解不精确性的度量,以支持实际实现。
  • 提出单调不精确张量方法 I 和 II,以及带平均的不精确张量方法,所有方法在 $\varepsilon$-精度下均具有全局 $O(1/\varepsilon^{1/p})$ 复杂度。
  • 通过使用收缩邻近迭代 $\zeta_k := 1/k^{p+2}$,开发加速方案,实现 $\tilde{O}(1/\varepsilon^{1/(p+1)})$ 复杂度。
  • 利用伸缩不等式与高阶导数的利普希茨界推导收敛性与复杂度边界。
  • 在子问题求解中采用单调不精确张量步长,通过函数值下降控制残差误差。

实验结果

研究问题

  • RQ1当使用动态精度规则时,不精确张量方法是否能保持与精确方法相同的全局收敛速率?
  • RQ2基于目标函数进展的动态精度规则是否能为 $p \geq 2$ 的情况带来局部超线性收敛?
  • RQ3加速的不精确张量方案是否能相比标准不精确方法实现更优的复杂度边界?
  • RQ4不同动态精度策略对机器学习问题上的实际性能有何影响?
  • RQ5为保持高阶方法的全局收敛速率,子问题解的最小精度要求是什么?

主要发现

  • 动态精度规则 $\delta_k := 1/k^{p+1}$ 确保了与精确情况相同的全局收敛速率 $O(1/\varepsilon^{1/p})$。
  • 对于规则 $\delta_k := c \cdot (F(x_{k-2}) - F(x_{k-1}))$,方法实现了全局 $O(1/\varepsilon^{1/p})$ 复杂度,并在一致凸条件下达到线性收敛速率。
  • 当 $\delta_k := c \cdot (F(x_{k-2}) - F(x_{k-1}))^{(p+1)/2}$ 时,对强凸目标函数,$p \geq 2$ 的情况下可建立局部超线性收敛。
  • 加速的不精确张量方案实现了 $\tilde{O}(1/\varepsilon^{1/(p+1)})$ 复杂度,优于标准不精确方法。
  • 数值结果证实了动态精度策略在多种机器学习问题上的有效性。
  • 复杂度边界通过伸缩不等式与高阶导数的利普希茨连续性推导得出,条件数由绝对常数有界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。