Skip to main content
QUICK REVIEW

[论文解读] A parallel Heap-Cell Method for Eikonal equations

Adam Chacon, Alexander Vladimirsky|arXiv (Cornell University)|Jun 20, 2013
Advanced Numerical Methods in Computational Mathematics参考文献 24被引用 4
一句话总结

本论文提出了一种并行堆单元法(pHCM),用于在共享内存架构上求解Eikonal方程,结合了串行堆单元法(HCM)的效率与单元间的并行化。pHCM在具有高每单元工作量的问题上表现出高度可扩展性和加速比,数值实验结果表明其在3D网格上的性能优于串行求解器和并行化快速扫掠法(FSM/LSM)。

ABSTRACT

Numerous applications of Eikonal equations prompted the development of many efficient numerical algorithms. The Heap-Cell Method (HCM) is a recent serial two-scale technique that has been shown to have advantages over other serial state-of-the-art solvers for a wide range of problems. This paper presents a parallelization of HCM for a shared memory architecture. The numerical experiments in $R^3$ show that the parallel HCM exhibits good algorithmic behavior and scales well, resulting in a very fast and practical solver. We further explore the influence on performance and scaling of data precision, early termination criteria, and the hardware architecture. A shorter version of this manuscript (omitting these more detailed tests) has been submitted to SIAM Journal on Scientific Computing in 2012.

研究动机与目标

  • 开发一种用于在共享内存架构上求解Eikonal方程的可扩展并行算法。
  • 改进串行求解器(如HCM)和并行化快速扫掠法(FSM/LSM)在大规模3D问题上的性能。
  • 研究数据精度、早期终止和硬件架构对pHCM性能与可扩展性的影响。
  • 在需要高计算吞吐量的应用中实现Eikonal方程的高效求解,例如机器人导航和地震成像。
  • 探索将pHCM扩展至各向异性Hamilton-Jacobi方程及混合CPU-GPU架构的可行性。

提出的方法

  • pHCM将计算域划分为空间单元,每个单元独立使用基于堆的标签设定策略,与HCM类似。
  • 每个线程管理一组单元,对每个单元执行顺序扫掠,同时维护一个共享的全局堆以管理活动节点。
  • 该方法采用两级策略:单元内的局部扫掠与通过堆数据结构实现的全局传播,以确保因果性和收敛性。
  • 引入一种新颖的单元值启发式方法(公式4),以减少冗余计算,尤其在速度函数存在错位间断的问题中效果显著。
  • 基于收敛准则,算法支持在单元内实现早期终止,从而减少不必要的扫掠次数。
  • 通过空间和时间局部性启发式优化内存访问,且该方法专为具有缓存感知访问模式的共享内存系统设计。

实验结果

研究问题

  • RQ1在共享内存系统上,pHCM在3D Eikonal问题上如何随核心数量扩展?
  • RQ2数据精度(如32位与64位)对pHCM性能和准确性有何影响?
  • RQ3早期终止准则如何影响pHCM的总工作量和运行时间?
  • RQ4何种单元分解策略(如单元大小、单元数量)能为给定问题规模和硬件条件提供最佳性能?
  • RQ5pHCM能否在加速比和工作效率方面优于现有并行Eikonal求解器(如并行化FSM/LSM)?

主要发现

  • 在64³的3D网格上,pHCM实现了强可扩展性,加速比随问题规模和每单元工作量增加而提升。
  • 对于M=64³,使用新单元启发式(公式4)的pHCM32将每单元平均扫掠次数从8366(使用启发式3时)降低至20.4,显著减少了计算工作量。
  • 在工作效率(AvS)方面,pHCM32优于HCM32,尽管运行时间略有增加(因开销所致),表明其具有更优的算法行为。
  • 新单元启发式(公式4)提升了大单元的可扩展性,尤其在速度函数存在非对齐间断的问题中表现更优。
  • 当单元尺寸较大或单元内扫掠需多次迭代时,性能提升最为显著,表明高每单元工作量场景下收益最大。
  • 该方法在扩展至各向异性Hamilton-Jacobi方程及混合CPU-GPU架构方面具有潜力,但分布式内存扩展仍具挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。