Skip to main content
QUICK REVIEW

[论文解读] Leverage Score Sampling for Faster Accelerated Regression and ERM

Naman Agarwal, Sham M. Kakade|arXiv (Cornell University)|Nov 22, 2017
Stochastic Gradient Optimization Techniques参考文献 9被引用 8
一句话总结

本文提出了一种新颖的回归算法,通过利用杠杆系数采样,实现了在求解最小二乘回归和经验风险最小化(ERM)问题时更快的收敛速度。通过将杠杆系数采样与邻近点方法及加速坐标下降相结合,该方法实现了 $\widetilde{O}((n + \sqrt{d \cdot \kappa_{\text{sum}}}) \cdot s \cdot \log \epsilon^{-1})$ 的运行时间,当杠杆系数较小时,其性能优于先前的界限。

ABSTRACT

Given a matrix $\mathbf{A}\in\mathbb{R}^{n imes d}$ and a vector $b \in\mathbb{R}^{d}$, we show how to compute an $ε$-approximate solution to the regression problem $ \min_{x\in\mathbb{R}^{d}}\frac{1}{2} \|\mathbf{A} x - b\|_{2}^{2} $ in time $ ilde{O} ((n+\sqrt{d\cdotκ_{ ext{sum}}})\cdot s\cdot\logε^{-1}) $ where $κ_{ ext{sum}}=\mathrm{tr}\left(\mathbf{A}^{ op}\mathbf{A} ight)/λ_{\min}(\mathbf{A}^{T}\mathbf{A})$ and $s$ is the maximum number of non-zero entries in a row of $\mathbf{A}$. Our algorithm improves upon the previous best running time of $ ilde{O} ((n+\sqrt{n \cdotκ_{ ext{sum}}})\cdot s\cdot\logε^{-1})$. We achieve our result through a careful combination of leverage score sampling techniques, proximal point methods, and accelerated coordinate descent. Our method not only matches the performance of previous methods, but further improves whenever leverage scores of rows are small (up to polylogarithmic factors). We also provide a non-linear generalization of these results that improves the running time for solving a broader class of ERM problems.

研究动机与目标

  • 解决当条件数 $\kappa_{\text{sum}}$ 较大时,大规模最小二乘回归和ERM问题中的计算瓶颈。
  • 克服先前方法在 $\sqrt{n \cdot \kappa_{\text{sum}}}$ 上扩展的局限性,当行杠杆系数较小时,该扩展可能表现次优。
  • 开发一种更快的迭代回归算法,通过结构化采样与加速,实现对 $n$ 和 $\kappa_{\text{sum}}$ 的改进依赖关系。
  • 将该框架扩展至非线性 ERM 问题,从而扩大其在非线性回归之外的应用范围。

提出的方法

  • 使用杠杆系数采样构建一个预处理子问题,以降低条件数并加速收敛。
  • 应用邻近点方法将原始回归问题转化为一系列条件性更好的子问题序列。
  • 集成加速坐标下降法,以依赖于稀疏度 $s$ 和有效维度的时间高效求解每个子问题。
  • 将总条件数 $\kappa_{\text{sum}} = \mathrm{tr}(\mathbf{A}^T\mathbf{A}) / \lambda_{\min}(\mathbf{A}^T\mathbf{A})$ 作为关键正则化参数,以控制收敛速率。
  • 设计一种基于行概率与杠杆系数成比例的概率分布,以确保稳定且快速的收敛。
  • 通过 $\mathbf{A}^T\mathbf{A}$-范数的基变换分析变换空间中的光滑性与梯度方差。

实验结果

研究问题

  • RQ1杠杆系数采样能否在加速回归算法中进一步降低对 $n$ 的依赖,超越先前的界限?
  • RQ2当行杠杆系数较小时,即使 $\kappa_{\text{sum}}$ 保持较大,所提出的方法是否仍能实现更快的收敛?
  • RQ3该框架能否推广至非线性 ERM 问题,同时保持改进的运行时间保证?
  • RQ4邻近点方法与加速坐标下降的结合如何在基于采样的预处理背景下提升收敛性?
  • RQ5何种最优采样分布能最小化有效条件数并加速回归中的收敛?

主要发现

  • 所提算法实现了 $\widetilde{O}((n + \sqrt{d \cdot \kappa_{\text{sum}}}) \cdot s \cdot \log \epsilon^{-1})$ 的运行时间,优于先前最优界限 $\widetilde{O}((n + \sqrt{n \cdot \kappa_{\text{sum}}}) \cdot s \cdot \log \epsilon^{-1})$。
  • 当行杠杆系数较小时,改进效果更加显著,原因在于其依赖于 $\sqrt{d \cdot \kappa_{\text{sum}}}$ 而非 $\sqrt{n \cdot \kappa_{\text{sum}}}$。
  • 该方法在性能上与先前最先进的算法相当,但在行杠杆系数较低的设置下提供了可证明的改进。
  • 分析表明,预处理空间中期望梯度范数以 $O(1/m)$ 的速率衰减,从而确保了具有加速的线性收敛。
  • 通过将类似的采样与加速技术应用于 Hessian 结构,该框架可推广至非线性 ERM 问题。
  • 证明依赖于一种新颖的基变换与 $\mathbf{A}^T\mathbf{A}$-范数下的光滑性分析,表明有效光滑性参数被 $\sum_j \tau_j \cdot M$ 所有界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。