Skip to main content
QUICK REVIEW

[论文解读] Adaptive Newton Method for Empirical Risk Minimization to Statistical Accuracy

Aryan Mokhtari, Alejandro Ribeiro|arXiv (Cornell University)|May 24, 2016
Gaussian Processes and Bayesian Inference被引用 11
一句话总结

该论文提出 Ada Newton,一种用于经验风险最小化的自适应牛顿方法,通过在每一步将训练集大小按大于1的因子动态增加,确保每次牛顿迭代仅需一次更新即可达到统计精度。该方法在约两轮数据集遍历内实现完整统计精度,优于 SAGA 和 SGD 等一阶方法,同时仅需对 O(log N) 个 Hessian 矩阵进行求逆。

ABSTRACT

We consider empirical risk minimization for large-scale datasets. We introduce Ada Newton as an adaptive algorithm that uses Newton's method with adaptive sample sizes. The main idea of Ada Newton is to increase the size of the training set by a factor larger than one in a way that the minimization variable for the current training set is in the local neighborhood of the optimal argument of the next training set. This allows to exploit the quadratic convergence property of Newton's method and reach the statistical accuracy of each training set with only one iteration of Newton's method. We show theoretically and empirically that Ada Newton can double the size of the training set in each iteration to achieve the statistical accuracy of the full training set with about two passes over the dataset.

研究动机与目标

  • 解决在大规模经验风险最小化(ERM)中以最小计算成本实现统计精度的挑战。
  • 克服随机二阶方法的局限性,包括对线搜索的依赖、缺乏二次收敛性以及 Hessian 矩阵求逆成本高昂的问题。
  • 开发一种算法,利用牛顿法的二次收敛性,同时无需线搜索或求解超过统计精度。
  • 通过自适应增加样本量,同时保持与下一阶段最优解的接近性,实现高效优化。
  • 在最小化数据集遍历次数和相比标准牛顿方法显著减少 Hessian 矩阵求逆次数的前提下,实现接近最优的收敛速度。

提出的方法

  • 在每次迭代中,以大于1的因子 α 自适应地增加样本量,起始样本量为 m₀。
  • 在经验风险 Rₙ 上施加一个阶为 Vₙ 的二次正则化项,确保正则化问题保持统计精度 Vₙ。
  • 确保当前样本量为 m 的解 wₘ 位于更大问题 Rₙ(其中 n = αm)的二次收敛区域内。
  • 在每个阶段仅使用单位步长进行一次牛顿迭代,保证收敛至当前样本量的统计精度。
  • 利用每次牛顿步长后次优性间隙平方的特性,实现仅在当前解位于下一问题的二次收敛区域时,才进行激进的样本量增长。
  • 通过仅对递增的样本量求逆 Hessian 矩阵,将 Hessian 矩阵求逆次数限制在 logₐN 次,其中 N 为完整数据集大小。

实验结果

研究问题

  • RQ1牛顿法能否被调整以在 ERM 中实现统计精度,而无需线搜索或完整数据集遍历?
  • RQ2通过控制初始解与下一最优解的接近程度,是否可能在样本量递增的过程中保持牛顿法的二次收敛性?
  • RQ3何种样本量增长因子 α 可使算法在约两轮数据集遍历内收敛至统计精度?
  • RQ4阶为 Vₙ 的自适应正则化如何影响在递增样本量下牛顿迭代的稳定性和收敛性?
  • RQ5是否可将 Hessian 矩阵求逆次数减少至 O(log N) 的同时,仍能在大规模 ERM 中实现统计精度?

主要发现

  • 对于蛋白质同源性数据集,Ada Newton 在约 2.4 次数据集遍历内达到 O(1/N) 阶的统计精度,与理论边界 α/(α−1) = 2(当 α = 2 时)非常接近。
  • 牛顿法需要 7.5 次遍历才能达到相同精度,而 SAGA 需要 10 次遍历,SGD 即使在 25 次遍历后仍无法达到 O(1/N) 精度。
  • 在运行时间方面,Ada Newton 在 25 秒内达到统计精度,优于 SAGA 所需的 62 秒。
  • 当样本量达到完整数据集大小时,该方法的收敛性变为二次,因为此时解已处于完整问题的二次收敛区域内。
  • Ada Newton 对初始条件具有鲁棒性,避免了标准牛顿方法中昂贵的预热阶段。
  • 理论分析表明,每次牛顿步长后次优性间隙会平方,从而仅在当前解位于下一问题的二次收敛区域时,才可实现激进的样本量增长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。