Skip to main content
QUICK REVIEW

[论文解读] A scalable H-matrix approach for the solution of boundary integral equations on multi-GPU clusters

Helmut Harbrecht, Peter Zaspel|arXiv (Cornell University)|Jun 20, 2018
Electromagnetic Scattering and Analysis参考文献 27被引用 3
一句话总结

本文提出了一种可扩展的、基于多GPU的分布式内存H-矩阵库(hmglib),用于通过边界元法(BEM)求解大规模边界积分方程。该库在单GPU H-矩阵库的基础上扩展,采用基于任务的执行模型支持分布式内存并行计算,在128到1024块GPU之间实现了超过67%的相对加速,并在Titan超级计算机上于6分钟内求解了包含150万个未知数的问题。

ABSTRACT

In this work, we consider the solution of boundary integral equations by means of a scalable hierarchical matrix approach on clusters equipped with graphics hardware, i.e. graphics processing units (GPUs). To this end, we extend our existing single-GPU hierarchical matrix library hmglib such that it is able to scale on many GPUs and such that it can be coupled to arbitrary application codes. Using a model GPU implementation of a boundary element method (BEM) solver, we are able to achieve more than 67 percent relative parallel speed-up going from 128 to 1024 GPUs for a model geometry test case with 1.5 million unknowns and a real-world geometry test case with almost 1.2 million unknowns. On 1024 GPUs of the cluster Titan, it takes less than 6 minutes to solve the 1.5 million unknowns problem, with 5.7 minutes for the setup phase and 20 seconds for the iterative solver. To the best of the authors' knowledge, we here discuss the first fully GPU-based distributed-memory parallel hierarchical matrix Open Source library using the traditional H-matrix format and adaptive cross approximation with an application to BEM problems.

研究动机与目标

  • 解决包含数百万个未知数的大规模BEM问题所面临的高计算成本和内存需求。
  • 通过在多GPU集群上实现分布式内存并行计算,克服单节点GPU计算的局限性。
  • 扩展现有的单GPU hmglib库,通过通用接口支持任意BEM应用代码,实现矩阵条目计算和自由度几何位置的访问。
  • 在大规模GPU集群上实现H-矩阵组装和BEM离散化产生的线性系统求解的高并行效率与可扩展性。
  • 通过自适应交叉近似(ACA)和H-矩阵格式,实现完全基于GPU的分布式内存H-矩阵计算,并开源提供。

提出的方法

  • 通过在多个GPU上采用基于任务的执行模型,扩展hmglib库以支持分布式内存并行计算。
  • 实现通用接口,通过暴露矩阵条目计算和自由度几何位置,支持与任意BEM代码的集成。
  • 在GPU内存中预计算并存储密集(非可适配)块和低秩(可适配)块,这对BEM应用至关重要。
  • 采用传统的H-矩阵格式结合自适应交叉近似(ACA)实现纯代数低秩矩阵压缩,支持O(N log N)的矩阵-向量乘积。
  • 利用GPU加速的密集矩阵运算内核和基于ACA的低秩近似,实现GPU节点间的负载均衡。
  • 将扩展后的hmglib与基于分片常数边界元的模型GPU BEM求解器集成,采用共轭梯度(CG)等迭代求解器。

实验结果

研究问题

  • RQ1基于GPU的H-矩阵库能否在大规模GPU分布式内存集群上有效扩展,以求解大规模BEM问题?
  • RQ2采用基于任务的多GPU H-矩阵实现,在128到1024块GPU之间扩展时,能实现多高的并行加速?
  • RQ3在包含数百万个未知数的真实世界和模型几何形状下,扩展后的hmglib库在设置和求解时间方面的性能表现如何?
  • RQ4在GPU上使用批处理和基于任务的并行计算时,负载均衡和性能扩展的主要瓶颈是什么?
  • RQ5所提出的方法能否在大规模BEM问题中实现H-矩阵构建和迭代求解阶段的高效率?

主要发现

  • 在128到1024块GPU之间扩展时,扩展后的hmglib库在包含150万个未知数的模型立方体几何上实现了超过67%的相对并行加速。
  • 对于包含118万个未知数的真实齿轮轮齿几何,该库在128到1024块GPU之间实现了超过68%的相对加速。
  • 在1024块GPU上,150万个未知数的问题在6分钟内求解完成,其中H-矩阵构建耗时5.7分钟,CG迭代求解仅耗时20秒。
  • 在1024块GPU上,真实齿轮轮齿问题的完整求解耗时8.8分钟,其中构建阶段耗时8.3分钟,CG求解时间不足29秒。
  • 性能分析表明,密集矩阵运算的负载均衡良好(峰值约15秒),而ACA近似则表现出显著的负载不平衡,部分GPU耗时超过300秒。
  • 研究结果证实,所提出的多GPU H-矩阵方法在大规模BEM问题中具有良好的可扩展性和高效性,在合成与真实世界几何形状上均表现出强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。