Skip to main content
QUICK REVIEW

[论文解读] Dimension Independent Matrix Square using MapReduce

Reza Bosagh Zadeh, Gunnar Carlsson|arXiv (Cornell University)|Apr 4, 2013
Stochastic Gradient Optimization Techniques参考文献 29被引用 18
一句话总结

该论文提出 DIMSUM,一种在分布式 MapReduce 环境中通过非自适应采样高效计算矩阵平方 $A^T A$ 的维度无关算法。其 shuffle 大小为 $O(n^2 / \epsilon^2)$,reduce-key 复杂度为 $O(n / \epsilon^2)$,且与 $m$ 无关,从而实现了对 $m \gg n$ 的大规模稀疏矩阵的可扩展 SVD 计算。该方法以高概率保持奇异值,并针对非负矩阵进行了优化,当估计高相似度条目时,shuffle 大小可降低至 $O(n \log n / s)$,其中 $s$ 为最小余弦相似度。

ABSTRACT

We compute the singular values of an $m imes n$ sparse matrix $A$ in a distributed setting, without communication dependence on $m$, which is useful for very large $m$. In particular, we give a simple nonadaptive sampling scheme where the singular values of $A$ are estimated within relative error with constant probability. Our proven bounds focus on the MapReduce framework, which has become the de facto tool for handling such large matrices that cannot be stored or even streamed through a single machine. On the way, we give a general method to compute $A^TA$. We preserve singular values of $A^TA$ with $ε$ relative error with shuffle size $O(n^2/ε^2)$ and reduce-key complexity $O(n/ε^2)$. We further show that if only specific entries of $A^TA$ are required and $A$ has nonnegative entries, then we can reduce the shuffle size to $O(n \log(n) / s)$ and reduce-key complexity to $O(\log(n)/s)$, where $s$ is the minimum cosine similarity for the entries being estimated. All of our bounds are independent of $m$, the larger dimension. We provide open-source implementations in Spark and Scalding, along with experiments in an industrial setting.

研究动机与目标

  • 为解决在 $m \gg n$ 的大规模稀疏矩阵 $m \times n$ 中计算 $A^T A$ 时因 $m$ 过大而无法在单台机器上存储或流式处理的可扩展性瓶颈。
  • 在分布式 SVD 计算中消除对 $m$ 的通信与计算依赖,从而在高维数据场景中实现高效的奇异值估计。
  • 提供一种可证明准确的非自适应采样方案,仅使用 $O(n^2 / \epsilon^2)$ 的 shuffle 大小和 $O(n / \epsilon^2)$ 的 reduce-key 复杂度,即可保持 $A^T A$ 条目的相对误差界。
  • 通过利用列对之间的高余弦相似度,对非负矩阵进行优化,当估计余弦相似度 $\geq s$ 的条目时,将 shuffle 大小减少至 $O(n \log n / s)$,reduce-key 复杂度减少至 $O(\log n / s)$,从而提升高相似度对的效率。

提出的方法

  • 提出一种非自适应采样方案,其中 $A$ 的每一行通过 mapper 处理,基于归一化幅值和随机缩放,发出列对的加权乘积。
  • 使用随机估计器来估计 $A^T A$ 的条目,使得 reducer 输出的期望值等于列之间的归一化点积(余弦相似度)。
  • 采用 [23] 中的谱范数集中不等式,证明估计的 $A^T A$ 条目以常数概率落在 $\epsilon$ 相对误差范围内。
  • 引入一种更轻量的变体(LeanDIMSUM),通过使用求和 reducer 减少每行的随机数生成量,但放宽了成对独立性。
  • 应用 Chernoff 不等式,证明 shuffle 大小以高概率为 $O(n^2 / \epsilon^2)$,从而确保可扩展性。
  • 通过 $\min(1, \sqrt{\gamma}/\|c_j\|)$ 对列范数进行阈值处理,对非负矩阵进行优化,从而减少高幅值列的冗余发射。

实验结果

研究问题

  • RQ1能否在分布式 MapReduce 环境中实现 $A^T A$ 的计算,使得通信与计算与大维度 $m$ 无关?
  • RQ2估计 $A^T A$ 条目并实现相对误差 $\epsilon$ 所需的最小 shuffle 大小与 reduce-key 复杂度是多少?
  • RQ3能否通过利用列对之间的高余弦相似度,进一步优化非负矩阵的算法?
  • RQ4非自适应采样结合随机缩放是否能以常数概率在相对误差界内保持 $A$ 的奇异值?
  • RQ5估计 $A^T A$ 中高相似度条目的 shuffle 大小的理论下界是什么?DIMSUM 与之相比如何?

主要发现

  • 以 $\epsilon$ 相对误差估计 $A^T A$ 条目的 shuffle 大小为 $O(n^2 / \epsilon^2)$,且与 $m$ 无关,相比朴素方法 $O(mL^2)$ 显著提升。
  • reduce-key 复杂度为 $O(n / \epsilon^2)$,与 $m$ 无关,即使在 $m = 10^{13}$ 的情况下也具有可行性,从而支持实际的分布式计算。
  • 对于非负矩阵,当估计余弦相似度 $\geq s$ 的条目时,shuffle 大小可减少至 $O(n \log n / s)$,reduce-key 复杂度可减少至 $O(\log n / s)$,显著提升高相似度对的效率。
  • 该算法以常数概率在谱范数下实现相对误差界,其证明基于 [23] 中的新奇异值集中不等式。
  • 在 Twitter 的实验表明,部署 DIMSUM 后性能指标提升了 40%,验证了其在真实世界中的可扩展性与效率。
  • 开源实现已集成至 Spark 和 Scalding 的主流商业发行版中,证实了其实际采用与稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。