[论文解读] An inexact subsampled proximal Newton-type method for large-scale machine learning
该论文提出了一种用于大规模正则化有限和优化的不精确采样近似牛顿型方法,通过结合采样海森矩阵近似与加速随机一阶方法,高效求解子问题。该方法的复杂度为 $\tilde{\mathcal{O}}(d(n + \sqrt{\kappa d})\log(1/\epsilon))$ 次浮点运算,对于光滑正则化项的效率与 LiSSA 相当,且在 $n > d$ 时优于加速一阶方法,同时支持 $\ell_1$ 等非光滑正则化项。
We propose a fast proximal Newton-type algorithm for minimizing regularized finite sums that returns an $ε$-suboptimal point in $ ilde{\mathcal{O}}(d(n + \sqrt{κd})\log(\frac{1}ε))$ FLOPS, where $n$ is number of samples, $d$ is feature dimension, and $κ$ is the condition number. As long as $n > d$, the proposed method is more efficient than state-of-the-art accelerated stochastic first-order methods for non-smooth regularizers which requires $ ilde{\mathcal{O}}(d(n + \sqrt{κn})\log(\frac{1}ε))$ FLOPS. The key idea is to form the subsampled Newton subproblem in a way that preserves the finite sum structure of the objective, thereby allowing us to leverage recent developments in stochastic first-order methods to solve the subproblem. Experimental results verify that the proposed algorithm outperforms previous algorithms for $\ell_1$-regularized logistic regression on real datasets.
研究动机与目标
- 通过实现高效的海森矩阵近似,解决精确近似牛顿方法在大规模机器学习中计算效率低下的问题。
- 将二阶方法扩展至 $\ell_1$ 等非光滑正则化项,同时保持快速收敛速率。
- 实现与最先进随机一阶方法及 LiSSA 竞争的计算复杂度,尤其在样本数 $n$ 超过维度 $d$ 时。
- 通过采样海森矩阵近似保留目标函数光滑部分的有限和结构,从而利用方差减少的一阶求解器高效求解子问题。
提出的方法
- 通过基于杠杆度量采样的方式近似采样海森矩阵 $B_t$,以降低计算成本,从而构建近似牛顿子问题。
- 在当前迭代点 $w_t$ 附近对光滑部分 $f(w)$ 使用二次近似,形成结合梯度、海森矩阵近似与正则化项 $R(w)$ 的子问题。
- 使用 Catalyst 加速的 SVRG 近似求解子问题,确保梯度残差 $\|r_t\|_{B_t}^*$ 被控制在 $\theta_t \|v_t\|_{B_t}$ 以内,以维持收敛性。
- 采用自适应步长,分两个阶段设计:第一阶段确保全局收敛,第二阶段实现局部超线性收敛。
- 通过仅对海森矩阵计算进行采样,保留光滑部分的有限和结构,从而高效利用方差减少的一阶求解器。
- 通过控制子问题精度并基于相对残差范数设计停止条件,确保理论收敛性保障。
实验结果
研究问题
- RQ1能否通过采样海森矩阵,使近似牛顿型方法在具有非光滑正则化项的大规模机器学习问题中实现可扩展性?
- RQ2将采样海森矩阵近似与加速一阶方法结合求解子问题,是否能获得比最先进随机一阶方法更优计算复杂度的方法?
- RQ3此类方法的理论浮点运算复杂度是多少?在标准假设下,其与 LiSSA 和加速一阶方法相比如何?
- RQ4在真实数据集上,该方法在 $\ell_1$-正则化逻辑回归任务中的实际表现如何,尤其当 $n > d$ 时?
- RQ5该方法能否在保持超参数选择(如内层迭代次数)鲁棒性的同时,实现更优的收敛速度?
主要发现
- 所提方法的理论复杂度为 $\tilde{\mathcal{O}}(d(n + \sqrt{\kappa d})\log(1/\epsilon))$ 次浮点运算,对于光滑正则化项的效率与 LiSSA 相当,且在 $n > d$ 时优于加速一阶方法。
- 在 Covtype 和 MNIST 数据集上,该方法在运行时间上优于 LIBLINEAR、SVRG 和 SAGA,尤其在大正则化参数 $\lambda = 10^{-3}$ 时表现出近超线性收敛。
- 该算法对内层迭代次数的选择具有鲁棒性,性能在 $\texttt{inner} = 2$ 到 $6$ 之间保持稳定,但 $\texttt{inner} = 1$ 时性能显著下降,原因在于子问题精度不足。
- 在 Realsim 数据集上,当 $\lambda$ 较大时,该方法与 LIBLINEAR 表现相当,但整体更慢,原因在于未利用稀疏性,凸显了通用性与数据特异性优化之间的权衡。
- 当 $\lambda$ 增大时,收敛速率显著提升,因为从零初始化出发能更快获得更稀疏解,与文献中已有观察一致。
- 实验结果证实,该方法不仅理论复杂度更优,且在真实数据集上展现出更优的实际性能,验证了其高效性与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。