Skip to main content
QUICK REVIEW

[论文解读] Efficient volume sampling for row/column subset selection

Amit Deshpande, Luis Rademacher|arXiv (Cornell University)|Apr 23, 2010
Sparse and Compressive Sensing Techniques参考文献 14被引用 10
一句话总结

本文提出了体积采样(volume sampling)的高效算法——即从矩阵中以所形成的单纯形体积的平方为概率选择k行子集——实现了近乎最优的低秩矩阵近似。该方法在O(kmn^ω log n)时间内实现了对Frobenius范数下最佳秩-k近似的√(k+1)-近似,匹配已知的下界,并优于以往方法。

ABSTRACT

We give efficient algorithms for volume sampling, i.e., for picking $k$-subsets of the rows of any given matrix with probabilities proportional to the squared volumes of the simplices defined by them and the origin (or the squared volumes of the parallelepipeds defined by these subsets of rows). This solves an open problem from the monograph on spectral algorithms by Kannan and Vempala. Our first algorithm for volume sampling $k$-subsets of rows from an $m$-by-$n$ matrix runs in $O(kmn^ω \log n)$ arithmetic operations and a second variant of it for $(1+ε)$-approximate volume sampling runs in $O(mn \log m \cdot k^{2}/ε^{2} + m \log^ω m \cdot k^{2ω+1}/ε^{2ω} \cdot \log(k ε^{-1} \log m))$ arithmetic operations, which is almost linear in the size of the input (i.e., the number of entries) for small $k$. Our efficient volume sampling algorithms imply several interesting results for low-rank matrix approximation.

研究动机与目标

  • 开发体积采样(一种基于所形成的单纯形与原点构成的体积平方来选择k行子集)的高效算法。
  • 解决谱算法领域中关于低秩矩阵近似下体积采样高效计算的开放问题。
  • 在Frobenius范数和谱范数下,为低秩矩阵近似的行/列子集选择问题提供近乎最优的近似保证。
  • 通过条件期望法提供一个确定性算法,其时间复杂度与随机版本相同。
  • 在仅使用单行的情况下,建立谱范数近似中近似质量的紧致下界。

提出的方法

  • 本文提出一种随机算法,通过利用子矩阵的特征多项式,以O(kmn^ω log n)次算术运算完成体积采样。
  • 采用基于条件期望法的变体对算法进行去随机化,实现相同时间复杂度的确定性计算。
  • 第二种算法在小k值下以接近线性时间(相对于输入规模)实现(1+ε)-近似体积采样,利用了先进的矩阵集中与采样技术。
  • 该方法依赖于计算Gram矩阵A_S A_S^T的行列式,其对应于所选行构成的平行多面体的体积平方。
  • 通过利用A_S A_S^T与A_S^T A_S的特征多项式之间的关系,降低计算成本。
  • 通过分析投影后残差矩阵的奇异值,将该方法扩展至处理谱范数近似。

实验结果

研究问题

  • RQ1对于大规模矩阵,体积采样能否被高效计算,尽管其在低秩近似中具有理论潜力?
  • RQ2通过体积采样进行行子集选择时,可达到的最佳近似因子是什么?能否在算法上实现该因子?
  • RQ3是否存在一种近乎线性时间的(1+ε)-近似体积采样算法,同时保持强近似保证?
  • RQ4行子集选择在谱范数近似中的固有局限性是什么?这些局限性如何随k和n变化?
  • RQ5与基于平方长度或SVD的采样方案相比,体积采样在近似质量与计算效率方面表现如何?

主要发现

  • 本文提出一种随机算法,可实现精确体积采样,时间复杂度为O(kmn^ω log n)次算术运算,具有实际应用的高效性。
  • 在Frobenius范数下,该算法实现了对最佳秩-k近似的√(k+1)-近似,该结果与已知下界一致,并优于此前的O(k√log k)-近似。
  • 通过条件期望法实现的确定性版本,达到了相同的近似因子与运行时间,确保了结果的可复现性。
  • 在谱范数近似中,相同的行子集可实现√((k+1)(n−k))-近似,且证明了即使在k=1时,也存在Ω(√n)的匹配下界。
  • 本文建立了仅使用单行时谱范数近似的紧致下界Ω(√n),表明在最坏情况下,任何单行都无法实现优于该近似因子的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。