Skip to main content
QUICK REVIEW

[论文解读] A Multi-Threaded Version of MCFM

John M. Campbell, R. Keith Ellis|arXiv (Cornell University)|Mar 20, 2015
Parallel Computing and Optimization Techniques被引用 7
一句话总结

本文提出了一种使用OpenMP实现多线程化的MCFM蒙特卡罗事件生成器,以实现多核处理器上的自动并行化。通过将OpenMP集成到VEGAS积分例程中,作者在NLO下实现了显著的加速——在Intel Xeon-Phi协处理器上最高达到119倍,且未牺牲数值精度,从而在极少用户干预的情况下实现了复杂高能物理过程的快速计算。

ABSTRACT

We report on our findings modifying MCFM using OpenMP to implement multi-threading. By using OpenMP, the modified MCFM will execute on any processor, automatically adjusting to the number of available threads. We modified the integration routine VEGAS to distribute the event evaluation over the threads, while combining all events at the end of every iteration to optimize the numerical integration. Special care has been taken that the results of the Monte Carlo integration are independent of the number of threads used, to facilitate the validation of the OpenMP version of MCFM.

研究动机与目标

  • 通过利用多核处理器架构,加速MCFM中的蒙特卡罗事件生成。
  • 在不改变不同线程数量下数值结果的前提下,使用OpenMP在MCFM中实现线程并行化。
  • 评估在多种硬件(包括CPU和Intel Xeon-Phi协处理器)上的性能扩展性。
  • 在无需用户配置的情况下,实现高能物理中下一阶修正(NLO)过程的快速计算。
  • 通过支持Xeon-Phi等新兴的众核架构,为未来硬件趋势做好MCFM的准备。

提出的方法

  • 修改MCFM中的VEGAS积分例程,将事件评估分布到OpenMP线程上,同时在每次迭代中合并结果以保持数值稳定性。
  • 使用OpenMP编译指令在FORTRAN代码中实现共享内存并行化,确保在无OpenMP支持编译时仍保持向后兼容性。
  • 通过在每次迭代后同步网格更新和积分权重,确保结果的线程独立性。
  • 基于可用硬件核心数自动调整线程数,无需用户配置。
  • 在多种架构上测试了实现:Intel Core i7、双Xeon X5650、AMD 6128 HE Opteron和Intel Xeon-Phi 5110P。
  • 通过事件生成速率和不同LO与NLO过程的加速因子来测量性能。

实验结果

研究问题

  • RQ1能否有效使用OpenMP对MCFM中的VEGAS积分进行并行化,而不会引入与线程相关的数值偏差?
  • RQ2多线程MCFM在不同CPU和众核架构上的性能扩展性如何?
  • RQ3在Intel Xeon-Phi协处理器上,NLO过程的最大可实现加速比是多少?哪些因素限制了性能?
  • RQ4多线程MCFM能否在不同线程数量下保持数值准确性和可重现性?
  • RQ5对于计算密集型的NLO计算,Xeon-Phi协处理器与传统CPU相比性能如何?

主要发现

  • 在Intel Xeon-Phi 5110P协处理器上,多线程MCFM对NLO过程的最大加速比达到119倍,每小时可生成1070万个事件。
  • 在NLO下,Xeon-Phi协处理器的加速持续至240个线程,单次评估耗时31.82秒,相比单线程执行实现119倍加速。
  • 在Intel Core i7-4770上,多线程版本每小时可生成1420万个NLO事件,显示出在标准CPU上的良好扩展性。
  • Xeon-Phi在LO过程中的性能受限于内存带宽,但在NLO下仍为计算受限,从而实现了高加速比。
  • OpenMP实现保持了不同线程数量下的数值一致性,确保了可重现性,并有利于验证。
  • 预计于2015年夏季推出的新型Xeon-Phi处理器将进一步提升性能,通过减少带宽瓶颈并提高核心性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。