Skip to main content
QUICK REVIEW

[论文解读] Solving Ridge Regression using Sketched Preconditioned SVRG

Alon Gonen, Francesco Orabona|arXiv (Cornell University)|Feb 7, 2016
Stochastic Gradient Optimization Techniques参考文献 12被引用 3
一句话总结

该论文提出了一种基于随机SVD近似的预处理加速SVRG方法,用于岭回归,通过聚焦于主导数据方向来加速收敛。通过使用经验相关矩阵的低秩近似进行预处理,该方法降低了有效条件数,从而在计算成本可控的前提下实现了显著的速度提升——尤其在谱衰减迅速时效果更明显。

ABSTRACT

We develop a novel preconditioning method for ridge regression, based on recent linear sketching methods. By equipping Stochastic Variance Reduced Gradient (SVRG) with this preconditioning process, we obtain a significant speed-up relative to fast stochastic methods such as SVRG, SDCA and SAG.

研究动机与目标

  • 解决高维岭回归中SVRG等随机方法因条件数差而导致的收敛缓慢问题。
  • 克服标准预处理方法的局限性,即需要求解原问题才能计算最优预条件子。
  • 开发一种计算高效的预处理策略,聚焦于主导数据方向,而无需求逆完整Hessian矩阵。
  • 通过结合随机投影与SVRG,实现在谱衰减迅速时的实际更快收敛。
  • 在大规模设置下,实现相对于标准SVRG及SDCA、SAG等方法的理论与实证加速。

提出的方法

  • 使用随机块Lanczos方法计算经验相关矩阵 $ C = \frac{1}{n}\sum_{i=1}^n x_i x_i^T $ 的低秩近似,重点关注主导特征模态。
  • 构造预条件子 $ P $ 作为 $ C + \lambda I $ 的低秩近似,具体为 $ P \approx \sum_{i=1}^k \lambda_i u_i u_i^T + \lambda I $,其中 $ k \ll d $。
  • 通过变换 $ \tilde{w} = P^{1/2} w $ 应用预条件子,将原始岭回归问题转化为条件数更优的预处理形式。
  • 将该预条件子集成至SVRG算法中,通过降低有效平均条件数 $ \tilde{\kappa} $ 实现更快收敛。
  • 采用基于投影的计算方法,在 $ O(ndk\log n) $ 时间内完成预条件子计算,使其可扩展至大规模 $ n $ 和 $ d $。
  • 将预处理SVRG整合进具有收敛性保证的随机优化框架中,实现 $ \tilde{O}((\tilde{\kappa} + n)d\log(1/\epsilon)) $ 的运行时间以达到 $ \epsilon $-精度。

实验结果

研究问题

  • RQ1基于主导数据方向的预条件子是否能在不引入高昂计算成本的前提下,显著降低岭回归中的有效条件数?
  • RQ2预处理SVRG在收敛速度与可扩展性方面,相较于标准SVRG及其他快速随机求解器表现如何?
  • RQ3将相关矩阵的低秩投影用作预条件子,对收敛速率的理论与实证影响是什么?
  • RQ4在何种设置下(如谱衰减模式),所提出的预处理方法能实现最大速度提升?
  • RQ5在高维、病态条件问题中,基于投影的预处理方法是否在降低条件数的同时保持收敛性保证?

主要发现

  • 所提出的基于投影的预处理SVRG在理论上实现了相对于标准SVRG的加速比 $ \frac{\sum_{i=1}^d \lambda_i}{k\lambda_k + \sum_{i>k}\lambda_i} $,当谱衰减迅速时该比值可极大提升。
  • 对于加速版SVRG,加速比变为 $ \sqrt{\sum_{i=1}^d \lambda_i / (k\lambda_k + \sum_{i>k}\lambda_i)} $,在有利的谱分布下进一步放大性能增益。
  • 在MNIST、CIFAR-10、RCV1和real-sim数据集上的实证结果表明,该方法收敛速度显著快于标准SVRG,尤其当 $ k=30 $ 时,即使正则化强度极小($ \lambda = 10^{-8} $)亦然。
  • 图2中的收敛曲线显示,所有数据集上,基于投影的预处理SVRG均以更少的训练轮次达到更低的次优性,验证了理论加速效果。
  • 在MNIST和CIFAR-10等数据集中,速度提升最为显著,图1中该比值在小 $ k $ 时急剧上升,表明其对谱衰减的强依赖性。
  • 对于小 $ k $,预处理开销可忽略不计,且该方法保持良好的可扩展性,使其在大规模机器学习应用中具备实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。