Skip to main content
QUICK REVIEW

[论文解读] Faster Kernel Ridge Regression Using Sketching and Preconditioning

Haim Avron, Kenneth L. Clarkson|arXiv (Cornell University)|Nov 10, 2016
Sparse and Compressive Sensing Techniques参考文献 30被引用 5
一句话总结

本文提出了一种针对核岭回归(KRR)的新型预条件技术,利用随机特征映射(如随机傅里叶特征)来加速迭代求解器。通过使用少量随机特征构建预条件矩阵,该方法降低了核矩阵的条件数,从而在实践中实现了近乎线性时间复杂度的快速且精确的KRR系统求解,且在包含多达一百万个样本的数据集上达到了最先进性能。

ABSTRACT

Kernel Ridge Regression (KRR) is a simple yet powerful technique for non-parametric regression whose computation amounts to solving a linear system. This system is usually dense and highly ill-conditioned. In addition, the dimensions of the matrix are the same as the number of data points, so direct methods are unrealistic for large-scale datasets. In this paper, we propose a preconditioning technique for accelerating the solution of the aforementioned linear system. The preconditioner is based on random feature maps, such as random Fourier features, which have recently emerged as a powerful technique for speeding up and scaling the training of kernel-based methods, such as kernel ridge regression, by resorting to approximations. However, random feature maps only provide crude approximations to the kernel function, so delivering state-of-the-art results by directly solving the approximated system requires the number of random features to be very large. We show that random feature maps can be much more effective in forming preconditioners, since under certain conditions a not-too-large number of random features is sufficient to yield an effective preconditioner. We empirically evaluate our method and show it is highly effective for datasets of up to one million training examples.

研究动机与目标

  • 解决核岭回归(KRR)的计算瓶颈问题,其需要以O(n³)的代价求解n个数据点的稠密病态线性系统。
  • 克服现有近似方法的局限性,这些方法为追求速度而牺牲了模型精度,尤其是在使用大量随机特征时。
  • 开发一种预条件策略,利用随机特征映射并非用于直接近似核函数,而是用于提升精确KRR系统上迭代求解器的收敛速度。
  • 通过使用少量随机特征来限制核矩阵的条件数,实现显著降低运行时间的高精度KRR解。
  • 在大规模数据集(包括多达一百万个训练样本)上展示该方法的有效性,且不损害泛化性能。

提出的方法

  • 使用随机特征映射(如随机傅里叶特征)对核矩阵构造预条件矩阵,而非直接利用其近似核函数。
  • 利用随机特征映射生成核矩阵的低秩近似,然后将其用于预条件化线性系统(K + λI)c = y。
  • 应用迭代Krylov子空间方法(如共轭梯度)求解预条件化系统,由于条件数改善,收敛速度显著提升。
  • 理论分析表明,对于多项式核,当随机特征数量与统计维数(有效自由度)成比例时,预条件化核矩阵的条件数有界。
  • 预条件矩阵可在O(ns²)时间内高效计算,其中s为随机特征数量,且s远小于n。
  • 该方法结合了压缩(通过随机特征)与预条件化,运行时间介于O(n²)与O(n³)之间,通常在实践中表现为O(n²)。

实验结果

研究问题

  • RQ1随机特征映射能否被有效用于非直接近似核函数,而是作为预条件器来加速精确KRR的迭代求解器?
  • RQ2随机特征数量与预条件化核矩阵条件数之间的理论关系是什么?
  • RQ3使用少量随机特征作为预条件器,是否能比使用大量特征的直接近似方法实现更快的收敛速度与更好的泛化性能?
  • RQ4该方法在大规模数据集上的可扩展性如何,特别是针对包含多达一百万个样本的数据集?
  • RQ5与非预条件化方法相比,该预条件化方法是否能提升迭代求解器在病态核矩阵上的鲁棒性与收敛性?

主要发现

  • 所提出的预条件化方法在实践中实现了近乎线性时间复杂度,通常表现为O(n²),显著优于标准的O(n³)直接方法。
  • 对于多项式核,当随机特征数量与统计维数成比例时,预条件化系统的条件数被有界为常数。
  • 在包含多达一百万个样本的数据集上,该方法的测试误差率优于非预条件化共轭梯度方法以及最先进的基于随机特征的求解器。
  • 该方法比非预条件化共轭梯度更鲁棒:后者在MNIST-200K与MNIST-300K数据集上未能收敛,而该方法成功收敛并实现了更低的误差率。
  • 即使容忍度为10⁻³,泛化误差也与10⁻²几乎相同,表明更紧的容忍度几乎无额外收益,验证了10⁻³在实现高精度结果中的合理性。
  • 该方法在不需大量随机特征的情况下保持了高模型精度,避免了直接随机特征近似方法中常见的性能下降问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。