Skip to main content
QUICK REVIEW

[论文解读] Optimal Rates for Learning with Nyström Stochastic Gradient Methods

Junhong Lin, Lorenzo Rosasco|arXiv (Cornell University)|Oct 21, 2017
Stochastic Gradient Optimization Techniques参考文献 29被引用 3
一句话总结

本文提出Nyström随机梯度方法(NySGM),一种将随机梯度下降与Nyström采样相结合的新型算法,用于非参数回归。通过利用小批量数据和自适应步长,NySGM在降低计算成本的前提下实现了最优学习率——时间复杂度为O(n^{1.5}),内存复杂度为O(n^{1.5}),相比Nyström KRR的O(n^2)显著降低,同时保持了最先进方法的统计性能。

ABSTRACT

In the setting of nonparametric regression, we propose and study a combination of stochastic gradient methods with Nyström subsampling, allowing multiple passes over the data and mini-batches. Generalization error bounds for the studied algorithm are provided. Particularly, optimal learning rates are derived considering different possible choices of the step-size, the mini-batch size, the number of iterations/passes, and the subsampling level. In comparison with state-of-the-art algorithms such as the classic stochastic gradient methods and kernel ridge regression with Nyström, the studied algorithm has advantages on the computational complexity, while achieving the same optimal learning rates. Moreover, our results indicate that using mini-batches can reduce the total computational cost while achieving the same optimal statistical results.

研究动机与目标

  • 开发一种适用于非参数回归的可扩展学习算法,在保持最优统计速率的同时降低计算成本。
  • 将Nyström采样与随机梯度方法结合,避免完整核矩阵的计算。
  • 分析泛化误差并推导在不同参数选择下的最优收敛速率。
  • 证明使用小批量可降低总计算成本,同时不损失统计性能。
  • 基于大偏差不等式、算子理论和凸分析提供理论保证。

提出的方法

  • 该算法使用从训练数据中均匀随机抽取的小批量进行随机梯度更新。
  • 在每次迭代中,解被投影到由一组代表性点(landmark points)所定义的Nyström近似核矩阵所确定的子空间上。
  • 采用时变步长η_t = η_1 t^{-θ},其中θ ∈ [0,1),以平衡收敛性与稳定性。
  • 联合优化采样水平、迭代次数、步长和小批量大小,以实现最优学习率。
  • 理论分析依赖于大偏差不等式、算子范数以及再生核希尔伯特空间(RKHS)的性质。
  • 在固定设计和随机设计两种设定下对方法进行分析,推导出泛化误差的误差界。

实验结果

研究问题

  • RQ1结合Nyström采样的随机梯度方法能否在非参数回归中实现最优学习率?
  • RQ2步长、小批量大小、迭代次数和采样水平的选择如何影响泛化误差?
  • RQ3在Nyström基SGD中使用小批量是否能降低总计算成本,同时保持最优统计性能?
  • RQ4所提出的算法能否在显著降低计算复杂度的前提下,达到核岭回归的最优误差界?
  • RQ5基于大偏差不等式和算子理论,能否为泛化误差建立理论保证?

主要发现

  • NySGM在仅遍历数据一次后即可实现O(n^{-0.5})的最优学习率,即使在问题无良性假设条件下亦成立。
  • 该算法的时间复杂度为O(n^{1.5}),内存复杂度为O(n^{1.5}),显著低于标准Nyström KRR的O(n^2)。
  • 使用小批量可在不损失最优统计性能的前提下降低总计算成本,这一优势与经典SGM形成反直觉对比。
  • 理论误差界为O((ηt)^{-(2ζ+1)}) + O(n^{-(2ζ+1)/(2ζ+γ+1)}),其中ζ ≤ 1/2,且以高概率成立。
  • 当采用近似勒贝格测度采样选择代表性点时,只要采样水平m ≳ n^{γ/(2ζ+γ+1)} log n,方法即可保持最优速率。
  • 通过交叉验证调优步长,可使误差界在高概率下与最优速率相差一个对数因子。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。