Skip to main content
QUICK REVIEW

[论文解读] Application of GPUs for the Calculation of Two Point Correlation Functions in Cosmology

Rafael Ponce, Miguel Cárdenas‐Montes|arXiv (Cornell University)|Apr 30, 2012
Scientific Research and Discoveries被引用 12
一句话总结

本文提出了一种基于CUDA的GPU实现,用于计算宇宙学中的角两两点相关函数(w(θ)),通过利用共享内存和原子操作来加速配对计数。该方法相较于CPU计算实现了100倍的加速,且统计偏差可忽略不计,使得大规模结构的高效分析成为可能,适用于未来的宇宙学巡天。

ABSTRACT

In this work, we have explored the advantages and drawbacks of using GPUs instead of CPUs in the calculation of a standard 2-point correlation function algorithm, which is useful for the analysis of Large Scale Structure of galaxies. Taking into account the huge volume of data foreseen in upcoming surveys, our main goal has been to accelerate significantly the analysis codes. We find that GPUs offer a 100-fold increase in speed with respect to a single CPU without a significant deviation in the results. For comparison's sake, an MPI version was developed as well. Some issues, like code implementation, which arise from using this option are discussed.

研究动机与目标

  • 加速大规模宇宙学星系星表的两两点相关函数(2pcf)计算,以满足未来高数据量巡天的需求。
  • 解决2pcf计算的计算瓶颈问题,由于其随源数量呈O(N²)增长,传统CPU计算速度过慢。
  • 探索GPU加速作为可扩展解决方案,以应对现代宇宙学巡天中预期的海量数据量。
  • 通过与成熟的CPU实现对比验证GPU结果的数值准确性,确认统计一致性在宇宙学方差范围内。

提出的方法

  • 在CUDA中实现Landy-Szalay估计器以计算w(θ),利用GPU架构的海量并行性。
  • 使用共享内存高效计算角度距离(通过点积和反余弦运算),减少全局内存访问次数。
  • 在共享内存中应用原子操作,安全地并行累积多个线程块的直方图计数(DD、DR、RR)。
  • 通过原子更新将共享内存中的部分直方图合并到全局内存,避免竞争条件。
  • 探索使用三块GPU的多GPU策略——两块用于DD/RR,一块用于DR——以最大化带宽和负载均衡。
  • 使用公开的MICE模拟星系星表验证实现,与标准CPU基于C语言的实现进行结果对比。

实验结果

研究问题

  • RQ1GPU加速是否能在不牺牲精度的前提下显著缩短宇宙学中两两点相关函数的计算时间?
  • RQ2与单个CPU和基于MPI的分布式CPU实现相比,CUDA基于GPU的实现性能如何?
  • RQ3哪些关键的GPU优化技术(如共享内存使用和原子操作)能够实现2pcf计算中高效直方图累积?
  • RQ4多GPU配置在大规模2pcf计算中能在多大程度上进一步提升性能?
  • RQ5GPU实现的结果与参考CPU代码在统计上相比如何,特别是在残差和宇宙学方差方面?

主要发现

  • 对于C2050 GPU,GPU实现相较于单个CPU实现了164倍的加速,执行时间从CPU的~5.76×10⁵秒降至~3.51×10³秒(对应1.72×10⁶个对象)。
  • 对于最大测试星表(6.89×10⁶个对象),GPU版本耗时5.61×10⁴秒(约1.56小时),而CPU耗时9.22×10⁶秒(约106天)。
  • GPU与CPU结果之间的残差可忽略不计,完全落在预期的宇宙学方差范围内,证实了数值准确性。
  • GTX295和C1060 GPU相较于CPU实现了约100倍的加速,且在多个星表规模下性能保持一致。
  • 多GPU配置通过将直方图计算分布在不同GPU上提升了效率,DD/RR与DR任务之间实现了最优负载均衡。
  • 尽管使用超过64个节点的MPI最终超越了GPU性能,但GPU方案在典型巡天规模分析中仍极具竞争力,且能效更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。