Skip to main content
QUICK REVIEW

[论文解读] Randomized Clustered Nystrom for Large-Scale Kernel Machines

Farhad Pourkamali‐Anaraki, Stephen Becker|arXiv (Cornell University)|Dec 20, 2016
Stochastic Gradient Optimization Techniques被引用 5
一句话总结

本文提出了一种随机聚类Nyström方法,通过使用随机投影对地标点进行聚类,并采用新型基于QR的算法,在使用多于目标秩的地标点时计算最优低秩近似,从而在大规模核机器学习中提升了效率与准确性。该方法在计算成本显著降低的情况下实现了接近SVD的准确性,尤其在高维数据上表现更优。

ABSTRACT

The Nystrom method has been popular for generating the low-rank approximation of kernel matrices that arise in many machine learning problems. The approximation quality of the Nystrom method depends crucially on the number of selected landmark points and the selection procedure. In this paper, we present a novel algorithm to compute the optimal Nystrom low-approximation when the number of landmark points exceed the target rank. Moreover, we introduce a randomized algorithm for generating landmark points that is scalable to large-scale data sets. The proposed method performs K-means clustering on low-dimensional random projections of a data set and, thus, leads to significant savings for high-dimensional data sets. Our theoretical results characterize the tradeoffs between the accuracy and efficiency of our proposed method. Extensive experiments demonstrate the competitive performance as well as the efficiency of our proposed method.

研究动机与目标

  • 改进基于Nyström的低秩近似在大规模核机器学习中的准确性和效率。
  • 解决现有聚类Nyström方法在高维数据上K-means聚类计算成本过高的问题。
  • 开发一种即使地标点数量超过目标秩r,也能实现最优秩-r近似的算法。
  • 通过基于随机投影的地标选择策略,实现近似准确性与计算效率之间的可调和权衡。

提出的方法

  • 提出一种新算法——'通过QR分解实现Nyström',当m > r时,利用QR分解从一组地标点中提取最优低秩因子,以计算最佳秩-r近似。
  • 引入一种随机地标选择策略,即在数据的低维随机投影上执行K-means聚类,从而降低内存和计算成本。
  • 使用随机投影(Achlioptas, 2003)将高维数据压缩至p′ ≈ 10维后再进行聚类,支持对数据的两遍处理。
  • 该方法可通过压缩因子γ进行调节,γ控制投影空间的维度,从而在准确性和效率之间实现平衡。
  • 理论分析(定理2)表明,该随机方法在近似低秩矩阵时与完整聚类Nyström相比,准确性损失极小。
  • 采用高斯核函数,并在核岭回归和核矩阵近似任务上评估性能。

实验结果

研究问题

  • RQ1当地标点数量超过目标秩时,是否能够更准确且高效地计算核矩阵的低秩近似?
  • RQ2随机投影是否能有效降低高维数据在K-means聚类前的维度,以用于地标点选择?
  • RQ3所提出的随机聚类Nyström方法是否在显著降低计算与内存成本的同时,仍能保持高近似准确性?
  • RQ4在准确性和运行时间方面,该方法与均匀采样、列范数采样以及完整聚类Nyström相比表现如何?

主要发现

  • 所提出的'通过QR分解实现Nyström'方法在m > r时相比标准Nyström方法实现了更优的近似准确性,且在相同准确性下所需地标点更少。
  • 在cpusmall数据集上(n=8,192, p=48),该方法在m=644时达到0.074的近似误差,运行时间与均匀采样在m=966时相当,但误差显著更低(0.187)。
  • 在E2006-tfidf数据集上(n=5,363, p=150,360),该方法相比完整聚类Nyström将计算复杂度降低了两个数量级,同时保持了近乎相同的准确性。
  • 对于r=82,该方法仅使用m=2r个地标点即达到接近SVD的准确性,优于均匀采样和列范数采样。
  • 当p′=10时,该方法的随机投影维度所实现的近似质量非常接近SVD或特征值分解所能达到的最佳秩-r近似。
  • 理论分析证实,该随机方法以高概率生成低秩近似,且与完整聚类Nyström方法相比,准确性损失极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。