Skip to main content
QUICK REVIEW

[论文解读] Tensor Methods for Minimizing Functions with H\"{o}lder Continuous Higher-Order Derivatives

Geovani Nunes Grapiglia, Yurii Nesterov|arXiv (Cornell University)|Apr 29, 2019
Mathematical Approximation and Integration参考文献 14被引用 14
一句话总结

本文提出了一类用于最小化具有 $p$ 次可微、$u$-H"{o}lder 连续 $p$ 阶导数的凸函数的加速与非加速张量方法。当 $u$ 已知时,非加速方案的迭代复杂度界为 $\mathcal{O}(\epsilon^{-1/(p+u-1)})$,加速方案的复杂度界为 $\mathcal{O}(\epsilon^{-1/(p+u)})$;当 $u$ 未知时,提出一种通用方案,其复杂度界为 $\mathcal{O}(\epsilon^{-p/[(p+1)(p+u-1)]})$,并建立了匹配的下界。

ABSTRACT

In this paper we study $p$-order methods for unconstrained minimization of convex functions that are $p$-times differentiable with $ u$-Holder continuous $p$th derivatives. We propose tensor schemes with and without acceleration. For the schemes without acceleration, we establish iteration complexity bounds of $\mathcal{O}\left(\epsilon^{-1/(p+ u-1)} ight)$ for reducing the functional residual below a given $\epsilon\in (0,1)$. Assuming that $ u$ is know, we obtain an improved complexity bound of $\mathcal{O}\left(\epsilon^{-1/(p+ u)} ight)$ for the corresponding accelerated scheme. For the case in which $ u$ is unknown, we present a universal accelerated tensor scheme with iteration complexity of $\mathcal{O}\left(\epsilon^{-p/[(p+1)(p+ u-1)]} ight)$. A lower complexity bound of $\mathcal{O}\left(\epsilon^{-2/[3(p+ u)-2]} ight)$ is also obtained for this problem class.

研究动机与目标

  • 开发针对具有 $p$ 次可微、$u$-H"{o}lder 连续 $p$ 阶导数的凸函数的高效张量优化方法。
  • 在关于 H"{o}lder 参数 $u$ 的不同假设下,建立非加速与加速张量方案的迭代复杂度界。
  • 设计一种可自适应未知 $u$ 的通用加速张量方案,无需事先知晓 $u$。
  • 推导出与所提方案匹配的理论下界,以验证其最优性。

提出的方法

  • 提出利用 $p$ 阶泰勒展开并结合 H"{o}lder 连续 $p$ 阶导数的 $p$ 阶张量方法。
  • 引入一种非加速张量方案,采用线搜索策略将函数残差降低至 $\epsilon$ 以下。
  • 设计一种加速张量方案,通过引入类似动量的更新机制提升收敛速度,假设 $u$ 已知。
  • 设计一种通用加速张量方案,可自适应调整步长,无需事先知晓 $u$。
  • 基于 H"{o}lder 参数 $u$ 进行复杂度分析,推导出迭代次数的上下界。
  • 采用统一框架,在不同 $u$ 假设下比较非加速、加速与通用方案。

实验结果

研究问题

  • RQ1使用 $p$ 阶方法最小化具有 $p$ 次可微、$u$-H"{o}lder 连续 $p$ 阶导数的凸函数时,最优的迭代复杂度是多少?
  • RQ2当 H"{o}lder 参数 $u$ 已知时,加速如何改善收敛速度?
  • RQ3能否设计一种可自适应未知 $u$ 的通用加速张量方案,且不牺牲收敛速率?
  • RQ4该类问题的理论迭代复杂度下界是什么?
  • RQ5所提方案与现有 $p$ 阶方法在收敛速率方面有何比较优势?

主要发现

  • 非加速张量方案在将函数残差降低至 $\epsilon$ 以下时,达到 $\mathcal{O}(\epsilon^{-1/(p+u-1)})$ 的迭代复杂度。
  • 当 $u$ 已知时,加速张量方案将复杂度提升至 $\mathcal{O}(\epsilon^{-1/(p+u)})$。
  • 当 $u$ 未知时,通用加速方案实现 $\mathcal{O}(\epsilon^{-p/[(p+1)(p+u-1)]})$ 的复杂度。
  • 建立了匹配的下界 $\mathcal{O}(\epsilon^{-2/[3(p+u)-2]})$,表明所提方案的最优性。
  • 结果表明,更高阶的光滑性($u$-H"{o}lder 连续性)在张量方法中显著提升了收敛速率。
  • 通用方案在无需事先知晓 $u$ 的前提下实现了接近最优的性能,使其在实际应用中更具鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。