Skip to main content
QUICK REVIEW

[论文解读] Randomized Block Cubic Newton Method

Nikita Doikov, Peter Richtárik|arXiv (Cornell University)|Feb 12, 2018
Stochastic Gradient Optimization Techniques参考文献 22被引用 3
一句话总结

本文提出随机化块三次牛顿(RBCN)方法,这是一种新颖的二阶优化算法,用于最小化由光滑项、二阶可微项和非光滑项组成的复合凸函数。通过结合块坐标随机化、三次正则化与邻近建模,RBCN 实现了最优收敛速率——$\mathcal{O}(1/\epsilon)$、$\mathcal{O}(1/\sqrt{\epsilon})$ 和 $\mathcal{O}(\log(1/\epsilon))$,并在正则化最小二乘、逻辑回归和泊松回归等机器学习问题上优于当前最先进方法。

ABSTRACT

We study the problem of minimizing the sum of three convex functions: a differentiable, twice-differentiable and a non-smooth term in a high dimensional setting. To this effect we propose and analyze a randomized block cubic Newton (RBCN) method, which in each iteration builds a model of the objective function formed as the sum of the natural models of its three components: a linear model with a quadratic regularizer for the differentiable term, a quadratic model with a cubic regularizer for the twice differentiable term, and perfect (proximal) model for the nonsmooth term. Our method in each iteration minimizes the model over a random subset of blocks of the search variable. RBCN is the first algorithm with these properties, generalizing several existing methods, matching the best known bounds in all special cases. We establish ${\cal O}(1/ε)$, ${\cal O}(1/\sqrtε)$ and ${\cal O}(\log (1/ε))$ rates under different assumptions on the component functions. Lastly, we show numerically that our method outperforms the state-of-the-art on a variety of machine learning problems, including cubically regularized least-squares, logistic regression with constraints, and Poisson regression.

研究动机与目标

  • 开发一种二阶优化方法,能够高效处理具有不同光滑性特性的复合凸问题:光滑项、二阶可微项和非光滑项。
  • 将块坐标随机化与三次正则化及邻近建模相结合,以降低计算成本,同时保持全局收敛性保证。
  • 将现有方法如三次牛顿法、随机牛顿法和邻近梯度法统一到一个框架中,并实现更优的收敛速率。
  • 在不同光滑性假设下,建立该方法的理论收敛速率。
  • 通过实验证明,RBCN 在多种机器学习任务中的总计算时间上优于当前最先进算法。

提出的方法

  • RBCN 使用三种不同的近似方式构建目标函数的模型:对光滑项 $g(x)$ 使用带二次正则化的线性模型,对二阶可微项 $\phi(x)$ 使用带三次正则化的二次模型,对非光滑项 $\psi(x)$ 使用精确(邻近)模型。
  • 在每次迭代中,该方法在变量 $x$ 的随机选择的块子集上最小化此复合模型,利用块结构以降低每次迭代的计算成本。
  • 该算法采用随机块采样策略(具体为 $\tau$-nice 采样)选择块,从而在高维设置下实现可扩展性,尤其适用于 $n$ 较大的情况。
  • 对于二阶可微项 $\phi_i(x_{(i)})$,该方法采用带三次正则化的二阶模型以捕捉曲率,从而在收敛性上优于二次模型。
  • 该方法引入 Hessian 矩阵的利普希茨常数 ($H_k$) 以确保全局收敛性和稳定性,其中 $H_k$ 取决于所选块上 $c_i$ 的最大值。
  • 该算法被设计为对 $\psi_i(x_{(i)})$ 实施邻近操作,即精确最小化该非光滑项,不进行近似,从而保持收敛性保证。

实验结果

研究问题

  • RQ1能否设计一种随机化块方法,将三次正则化与邻近建模相结合,以实现复合凸问题的最优收敛速率?
  • RQ2在随机化二阶方法中,块大小的选择如何影响收敛速度和计算成本?
  • RQ3所提出的方法能否在保持或超越其收敛速率的前提下,推广现有算法如三次牛顿法和随机牛顿法?
  • RQ4在不同光滑性假设下,该方法的理论收敛速率如何?
  • RQ5该方法在真实世界机器学习问题中是否在实践中优于当前最先进算法?

主要发现

  • 在不同组件函数的假设下,RBCN 实现了 $\mathcal{O}(1/\epsilon)$、$\mathcal{O}(1/\sqrt{\epsilon})$ 和 $\mathcal{O}(\log(1/\epsilon))$ 的收敛速率,所有特殊情况下的收敛速率均达到最优已知界。
  • 数值实验表明,使用中等大小的块(例如 25–50 个坐标)可使总计算时间最小化,实现迭代速度与每次迭代成本之间的最佳平衡。
  • 在合成的三次正则化最小二乘问题中,RBCN 在达到函数残差 $10^{-12}$ 精度的总时间上优于其他方法。
  • 在 $\ell_2$-正则化逻辑回归任务中,RBCN 在块大小为 25–50 时,其计算效率优于块坐标梯度下降法及其他方法。
  • 在泊松回归任务中,RBCN 达到相同精度所需的样本访问次数少于 SDCA 和 SDNA,展现出更优的实验效率。
  • 该方法在计算效率上与 SDNA 相当,同时在收敛速度上更快,尤其在 $m=1000$ 到 $m=319$ 个样本的合成与真实数据集上表现显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。