[论文解读] Stochastic Second-order Methods for Non-convex Optimization with Inexact Hessian and Gradient
本文提出随机信赖域(STR)和随机三阶正则化(SARC)方法,用于处理具有不精确梯度与海森矩阵估计的非凸优化问题,采用固定样本的随机逼近。研究证明,在较弱的不精确性条件下,即使梯度与海森矩阵不精确,两种方法在达到 $\epsilon$-近似二阶最优性时,其迭代复杂度与精确方法保持一致。实验验证了其在深度学习任务中的性能表现。
Trust region and cubic regularization methods have demonstrated good performance in small scale non-convex optimization, showing the ability to escape from saddle points. Each iteration of these methods involves computation of gradient, Hessian and function value in order to obtain the search direction and adjust the radius or cubic regularization parameter. However, exactly computing those quantities are too expensive in large-scale problems such as training deep networks. In this paper, we study a family of stochastic trust region and cubic regularization methods when gradient, Hessian and function values are computed inexactly, and show the iteration complexity to achieve $ε$-approximate second-order optimality is in the same order with previous work for which gradient and function values are computed exactly. The mild conditions on inexactness can be achieved in finite-sum minimization using random sampling. We show the algorithm performs well on training convolutional neural networks compared with previous second-order methods.
研究动机与目标
- 开发适用于大规模非凸优化中处理不精确梯度与海森矩阵估计的实际随机二阶方法。
- 在不精确海森矩阵与梯度近似条件下,理论分析STR与SARC的收敛性与迭代复杂度。
- 证明即使在梯度、海森矩阵与目标函数值计算存在不精确性时,迭代复杂度仍与精确方法保持相同阶数。
- 利用采样函数值实现信赖域半径与正则化参数的自适应调整。
- 通过实验验证所提方法在训练深度卷积神经网络中的性能,显示其在运行时间上的改进。
提出的方法
- 采用基于固定样本采样的不精确梯度与海森矩阵近似的随机信赖域(STR)与随机三阶正则化(SARC)方法。
- 使用二次模型 $ m_k(s) = f(x_k) + \langle g(x_k), s \rangle + \frac{1}{2} \langle s, B(x_k)s \rangle $,其中 $ g(x_k) $ 与 $ B(x_k) $ 为不精确估计,且误差有界且固定。
- 应用算子伯恩斯坦不等式以控制采样函数值的波动,从而实现信赖域半径与三阶正则化参数的自动调整。
- 提出基于采样目标函数值的自适应信赖域半径与正则化参数更新策略,即使在梯度、海森矩阵与函数值均不精确时亦可适用。
- 采用统一的分析框架,在不精确性条件下界定向成功概率与收敛速率,利用光滑性与有界海森矩阵变化的假设。
- 采用基于不精确梯度范数与不精确最小海森特征值的终止准则,以确保达到二阶最优性。
实验结果
研究问题
- RQ1当梯度与海森矩阵均不精确时,随机二阶方法是否仍能保持与精确方法相同的迭代复杂度?
- RQ2在何种不精确性条件下,可保证随机信赖域与三阶正则化方法收敛至 $\epsilon$-近似二阶最优性?
- RQ3当梯度与海森矩阵不精确时,是否可仅利用采样函数值实现信赖域半径与三阶正则化参数的自适应调整?
- RQ4在深度学习任务中,所提出的STR与SARC方法在收敛速度与训练时间方面,与现有随机二阶方法相比表现如何?
- RQ5是否可为采用固定样本梯度与海森矩阵近似的随机二阶方法提供理论收敛保证?
主要发现
- STR与SARC的迭代复杂度为 $\mathcal{O}(\max\{(\varepsilon_{\nabla f}-\varepsilon_g)^{-2}, (\varepsilon_H - \varepsilon_B)^{-3}\})$,在较弱的不精确性条件下,与精确方法的复杂度阶数一致。
- 当满足终止条件时,SARC的迭代复杂度可提升至 $\mathcal{O}(\max\{(\varepsilon_{\nabla f}-\varepsilon_g)^{-3/2}, (\varepsilon_H - \varepsilon_B)^{-3}\})$,优于STR。
- 即使使用固定样本随机逼近法计算梯度、海森矩阵与函数值,且存在固定有界不精确性,该方法仍能收敛至 $\epsilon$-近似二阶最优性。
- 利用算子伯恩斯坦不等式可实现函数值的可靠采样,从而支持信赖域半径与正则化参数的自动且自适应调整。
- 在CIFAR-10数据集上使用VGG网络的实验表明,所提STR与SARC方法在运行时间上优于现有信赖域与三阶正则化方法。
- 理论分析拓展了先前工作:允许不精确梯度(不同于[7]),并采用更弱的不精确性条件(不同于[8]),同时保持最优复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。