Skip to main content
QUICK REVIEW

[论文解读] Strong Scaling of Matrix Multiplication Algorithms and Memory-Independent Communication Lower Bounds

Grey Ballard, James Demmel|arXiv (Cornell University)|Feb 14, 2012
Stochastic Gradient Optimization Techniques参考文献 7被引用 16
一句话总结

本文为分布式内存系统中经典与基于Strassen的矩阵乘法算法建立了与内存无关的通信下界,证明了完美强扩展性(通信成本随处理器数量线性加速)的上限受问题规模和本地内存限制。下界表明,在这些阈值之后,通信成本呈次线性增长,即使在最优算法下也限制了强扩展性。

ABSTRACT

A parallel algorithm has perfect strong scaling if its running time on P processors is linear in 1/P, including all communication costs. Distributed-memory parallel algorithms for matrix multiplication with perfect strong scaling have only recently been found. One is based on classical matrix multiplication (Solomonik and Demmel, 2011), and one is based on Strassen's fast matrix multiplication (Ballard, Demmel, Holtz, Lipshitz, and Schwartz, 2012). Both algorithms scale perfectly, but only up to some number of processors where the inter-processor communication no longer scales. We obtain a memory-independent communication cost lower bound on classical and Strassen-based distributed-memory matrix multiplication algorithms. These bounds imply that no classical or Strassen-based parallel matrix multiplication algorithm can strongly scale perfectly beyond the ranges already attained by the two parallel algorithms mentioned above. The memory-independent bounds and the strong scaling bounds generalize to other algorithms.

研究动机与目标

  • 弥合已知通信上界与矩阵乘法算法理论下界之间的差距。
  • 分析在分布式内存矩阵乘法中完美强扩展性的极限,特别是针对经典与基于Strassen的算法。
  • 推导出可推广至矩阵乘法以外其他算法的与内存无关的通信下界。
  • 识别通信成本、问题规模与本地内存之间的根本权衡,这些因素限制了强扩展性能。

提出的方法

  • 使用基于计算DAG中边扩张的图论技术,推导出与内存无关的通信下界。
  • 采用分布式内存计算模型,其中带宽成本与通信字数成正比,延迟成本与发送消息数成正比。
  • 利用Strassen算法的递归结构及指数 ω₀ = log₂7 ≈ 2.81,推导出快速矩阵乘法的下界。
  • 证明对于足够大的 P,任何通信最优的算法在基于Strassen的算法中必须移动至少 Ω(n² / P²/ω₀) 个字。
  • 将分析扩展至经典矩阵乘法,证明在类似假设下存在下界 Ω(n² / P²/³)。
  • 将这些下界推广至形式为 f_ij(g_ijk(Mem(a), Mem(b))) 的其他算法,包括LU分解、Cholesky分解及稀疏矩阵运算。

实验结果

研究问题

  • RQ1在分布式内存环境下,基于Strassen的矩阵乘法的通信成本理论极限是什么?
  • RQ2是否可以在超过某一处理器数量后实现完美强扩展性?若不能,原因是什么?
  • RQ3与内存相关的通信下界相比,与内存无关的通信下界在确定强扩展上限时有何差异?
  • RQ4这些通信下界在多大程度上可推广至其他密集与稀疏线性代数算法?
  • RQ5问题规模、本地内存与可实现完美强扩展性的最大处理器数量之间存在何种关系?

主要发现

  • 本文为基于Strassen的矩阵乘法建立了与内存无关的通信下界 Ω(n² / P²/ω₀),其中 ω₀ = log₂7 ≈ 2.81。
  • 对于经典矩阵乘法,与内存无关的下界为 Ω(n² / P²/³),在超过某一处理器数量后占主导地位。
  • 完美强扩展性(随着处理器数量增加运行时间线性减少)仅在 P_max = Θ(P_min^{ω₀/2})(Strassen)与 P_max = Θ(P_min^{3/2})(经典乘法)以内可实现。
  • 强扩展范围在内存相关延迟下界变为常数时恰好结束,表明由于带宽扩展的限制存在一个硬性上限。
  • 超过阈值 P_max 后,通信成本按 1/P²/ω₀(Strassen)或 1/P²/³(经典)增长,而非按 1/P,因此破坏了完美强扩展性。
  • 推导出的下界可推广至其他算法,包括LU/Cholesky分解、稀疏矩阵-矩阵乘法及所有点对最短路径算法,在相同计算模型下成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。