Skip to main content
QUICK REVIEW

[论文解读] A faster hafnian formula for complex matrices and its benchmarking on a supercomputer

Andreas Björklund, Brajesh Gupt|arXiv (Cornell University)|May 31, 2018
Matrix Theory and Algorithms被引用 6
一句话总结

本文提出了一种新的 O(n³2ⁿ/²) 算法,通过舒尔分解计算复矩阵的霍夫曼行列式,显著加速了精确霍夫曼行列式计算。该方法相比先前基于环的算法实现了 n 倍的加速,并在 Titan 超级计算机上实现了近乎完美的弱缩放性能,使 56×56 大小的矩阵能够以高精度和高并行效率完成霍夫曼行列式计算。

ABSTRACT

We introduce new and simple algorithms for the calculation of the number of perfect matchings of complex weighted, undirected graphs with and without loops. Our compact formulas for the hafnian and loop hafnian of $n \ imes n $ complex matrices run in $O(n^3 2^{n/2})$ time, are embarrassingly parallelizable and, to the best of our knowledge, are the fastest exact algorithms to compute these quantities. Despite our highly optimized algorithm, numerical benchmarks on the Titan supercomputer with matrices up to size $56 \ imes 56$ indicate that one would require the 288000 CPUs of this machine for about a month and a half to compute the hafnian of a $100 \ imes 100$ matrix.

研究动机与目标

  • 开发一种更快的精确算法,用于计算复矩阵的霍夫曼行列式,该量在量子光学和组合数学中具有关键作用。
  • 降低模拟高斯玻色采样(一种量子优越性基准)时的计算瓶颈。
  • 利用混合 MPI+OpenMP 并行化,在超级计算机上实现可扩展的、高精度的霍夫曼行列式计算。
  • 确定在当前算法与架构约束下,经典硬件在大规模量子采样问题上的实际模拟极限。

提出的方法

  • 该算法将 Cygan 和 Pilipczuk 的基于环的霍夫曼行列式方法中的 O(n⁴) 动态规划表征替换为复矩阵的 O(n³) 舒尔分解。
  • 通过复数域上的初等线性代数推导出 n×n 复矩阵的霍夫曼行列式和环霍夫曼行列式的紧凑公式。
  • 该方法具有明显的可并行性,可利用混合 MPI 和 OpenMP 线程在数千个 CPU 核心上高效分发。
  • 在 Titan 超级计算机上进行了数值基准测试,最多使用 288,000 个 CPU,对最大至 56×56 的矩阵进行了弱缩放测试。
  • 该算法在分布式计算中保持了高数值精度,不同 MPI/OpenMP 进程配置下的误差变化可忽略不计。
  • 该方法旨在最小化指数缩放中的多项式前因子,这对评估量子优越性阈值至关重要。

实验结果

研究问题

  • RQ1能否仅使用标准线性代数运算,在 O(n³2ⁿ/²) 时间内计算复矩阵的霍夫曼行列式?
  • RQ2所提出的算法在具有混合并行性的大规模超级计算机上实际缩放性能如何?
  • RQ3在当前算法与架构约束下,经典硬件在精确霍夫曼行列式计算上的实际上限是什么?
  • RQ4该算法在多个处理器上进行分布式、非交换求和时,其精度在多大程度上保持稳定?

主要发现

  • 所提算法实现了 O(n³2ⁿ/²) 的时间复杂度,相比之前已知的最佳基于环的霍夫曼行列式算法,实现了 n 倍的加速。
  • 在 Titan 超级计算机上,使用 288,000 个 CPU 计算一个 56×56 的霍夫曼行列式约需 1.5 个月,表明在理想缩放下,100×100 的霍夫曼行列式至少也需要 1.5 个月。
  • 弱缩放实验表明,当矩阵尺寸和处理器数量同时加倍时,总计算时间趋于稳定,证实了在固定问题-处理器比下具有良好的弱缩放性能。
  • 该算法在最多 288,000 个 CPU 上表现出近乎完美的强缩放性能,计算时间随处理器数量加倍而减半。
  • 不同 MPI 和 OpenMP 进程配置下的霍夫曼行列式结果误差百分比保持极低,证实了在分布式求和下的数值鲁棒性。
  • 尽管已进行优化,对于 n > 60 的情况,经典硬件上精确计算霍夫曼行列式仍不可行,n=100 在 16 个处理器上约需 2155 年。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。