Skip to main content
QUICK REVIEW

[论文解读] An algorithm for the principal component analysis of large data sets

Nathan Halko, Per‐Gunnar Martinsson|arXiv (Cornell University)|Jul 30, 2010
Stochastic Gradient Optimization Techniques参考文献 12被引用 5
一句话总结

本文提出了一种用于处理远超主存储器容量的超大规模数据集的主成分分析(PCA)的随机化算法,采用基于随机投影和迭代Krylov子空间方法的外部存储方法。该方法在高概率下实现近乎最优的谱范数精度,即使在并行架构上亦然,且通过最小化磁盘I/O并利用随机采样近似主导奇异子空间,高效处理无法装入RAM的数据。

ABSTRACT

Recently popularized randomized methods for principal component analysis (PCA) efficiently and reliably produce nearly optimal accuracy --- even on parallel processors --- unlike the classical (deterministic) alternatives. We adapt one of these randomized methods for use with data sets that are too large to be stored in random-access memory (RAM). (The traditional terminology is that our procedure works efficiently "out-of-core.") We illustrate the performance of the algorithm via several numerical examples. For example, we report on the PCA of a data set stored on disk that is so large that less than a hundredth of it can fit in our computer's RAM.

研究动机与目标

  • 解决数据集过大而无法装入随机存取存储器(RAM)时执行PCA的挑战,实现在标准硬件上对大规模数据的分析。
  • 开发一种高效的外部存储算法,最小化磁盘访问并利用随机投影实现高精度。
  • 在几乎不依赖数据的前提下,以极大概率实现近乎最优的谱范数精度,即使对于奇异值衰减缓慢的情况亦然。
  • 实现可扩展、可并行化的PCA计算,适用于现代多核和分布式系统。
  • 在真实世界数据集(包括生物化学成像和大规模模拟)上展示该方法的鲁棒性和高效性。

提出的方法

  • 该算法使用随机投影构建一个低维子空间,以捕捉数据矩阵A的大部分值域。
  • 通过涉及A和A^T的矩阵-向量乘积序列生成类似Krylov的子空间,利用A A^T的幂次来增强子空间。
  • 对所得矩阵H应用选主元QR分解,以提取A主导值域的正交基Q。
  • 通过将A投影到正交基Q上并计算较小投影矩阵的SVD,构建低秩SVD近似A ≈ U Σ V^T。
  • 该算法旨在最小化每次矩阵元素被访问的次数,从而降低外部存储计算的I/O成本。
  • 使用基于幂方法的估计器近似近似误差的谱范数,其精度在两倍因子内具有极高概率。

实验结果

研究问题

  • RQ1随机化PCA能否被适配以在无法装入主内存的数据集上高效运行?
  • RQ2在保持近乎最优谱范数精度的前提下,如何最小化磁盘访问次数?
  • RQ3当少于1%的数据可装入RAM时,该算法的性能如何?
  • RQ4当奇异值衰减缓慢时,该方法是否仍能保持高精度?
  • RQ5该算法能否在多核或分布式系统上实现高效并行化?

主要发现

  • 该算法成功在仅少于1%的数据可装入RAM的数据集中执行了PCA,展示了稳健的外部存储性能。
  • 近似误差的谱范数始终接近σ_{k+1}(即第(k+1)个奇异值),表明实现了近乎最优的精度。
  • 对于大肠杆菌生物化学成像数据集,该算法通过将噪声图像投影到150个主导右奇异向量上,实现了有效的去噪。
  • 即使对于奇异值衰减缓慢的情况,该方法在仅少数迭代(如i=0或i=1)和较小的过采样(l=k+2)下仍能实现高精度。
  • 实现良好谱范数精度的概率大于1−10^{−15},且与数据无关,证实了理论保证。
  • 该算法的核心步骤具有良好的可并行性,适用于现代多核和分布式计算环境的部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。