Skip to main content
QUICK REVIEW

[论文解读] ParFORM: Parallel Version of the Symbolic Manipulation Program FORM

M. Tentyukov, D. Fliegner|ArXiv.org|Jul 30, 2004
Parallel Computing and Optimization Techniques参考文献 2被引用 8
一句话总结

ParFORM 是符号计算程序 FORM 的并行化版本,旨在加速量子场论中大规模代数表达式的处理。通过采用基于 MPI 的主从架构,它在多处理器系统上实现了接近线性的加速比,将诸如四圈费曼图约简等复杂计算的运行时间从数月缩短至数周。

ABSTRACT

After an introduction to the sequential version of FORM and the mechanisms behind, we report on the status of our project of parallelization. We have now a parallel version of FORM running on Cluster- and SMP-architectures. This version can be used to run arbitrary FORM programs in parallel.

研究动机与目标

  • 实现量子场论中大规模符号计算的高效并行执行。
  • 克服传统 FORM 在处理包含数十亿项的表达式时的性能瓶颈。
  • 开发一个透明的并行化层,无需对现有 FORM 程序进行任何修改。
  • 在 SMP 和集群架构上实现高性能加速,适用于计算密集型物理应用。
  • 支持真实世界的应用,如用于四圈积分约简的 BAICER 包。

提出的方法

  • 采用主从并行化模型,主节点将输入项分发给从节点处理器,并合并排序后的输出流。
  • 使用 MPI 进行消息传递,以支持共享内存(SMP)和分布式内存(集群)架构。
  • 利用 FORM 对本地项操作的原生支持,使每个处理器可独立处理各项。
  • 通过允许现有 FORM 程序在并行模式下无需修改即可运行,保持向后兼容性。
  • 通过将输入项均匀分发到所有可用处理器,实现动态负载均衡,以最小化空闲时间。
  • 将加速比测量结果相对于双处理器性能进行归一化,以评估可扩展性和效率。

实验结果

研究问题

  • RQ1FORM 的内部架构(仅支持本地项操作)能否自然扩展以支持可扩展的并行执行?
  • RQ2现有 FORM 程序在无需修改的情况下并行执行的范围有多大?其性能随处理器数量的增加如何变化?
  • RQ3在现代 SMP 和集群系统上,对真实世界高能物理计算可实现多大的加速比?
  • RQ4消息传递和数据分发的开销在处理器数量增加时对性能有何影响?
  • RQ5ParFORM 是否能使此前不可行的计算(如四圈费曼图约简)在实际运行时间内完成?

主要发现

  • 在配备 8 个 EV67 处理器的 Compaq-AlphaServer 上,ParFORM 在最多 8 个处理器时实现了接近线性的加速比,表明其对大规模符号表达式具有强大的可扩展性。
  • 在配备 32 个 Itanium2 处理器的 SGI Altix 3700 服务器上,ParFORM 在 16 个处理器时实现了 10 倍的加速比,将原本需一年的计算缩短至一个月以内。
  • 加速比在 16 个以上处理器时仍保持显著,32 个处理器时达到 12 倍加速比,表明负载分配高效且通信开销低。
  • 该系统在 32 个处理器的机器上同时支持两个作业,每个作业均实现了 10 倍加速比,证明其在生产级物理工作流中的实际可行性。
  • 真实世界应用如用于四圈积分约简的 BAICER 包仅通过 ParFORM 才成为可能,凸显其对高能物理研究的重要影响。
  • 现有 FORM 程序无需任何代码修改即可在并行模式下运行,证实了 ParFORM 设计的透明性和向后兼容性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。