Skip to main content
QUICK REVIEW

[论文解读] Cutting the cost of pulsar astronomy: Saving time and energy when searching for binary pulsars using NVIDIA GPUs

Jack White, Karel Adámek|arXiv (Cornell University)|Nov 24, 2022
Radio Astronomy Observations and Technology被引用 4
一句话总结

本文提出了一种混合优化策略,结合在NVIDIA A100 GPU上使用bfloat16的混合精度计算与动态频率调节,以降低在时域射电天文数据集中进行双星脉冲星检测的傅里叶域加速搜索(FDAS)的能耗。通过降低GPU时钟频率并使用低精度算术运算,该方法在数值灵敏度损失小于3%的情况下实现了58%的能耗降低,显著提升了能效,且未牺牲性能。

ABSTRACT

Using the Fourier Domain Acceleration Search (FDAS) method to search for binary pulsars is a computationally costly process. Next generation radio telescopes will have to perform FDAS in real time, as data volumes are too large to store. FDAS is a matched filtering approach for searching time-domain radio astronomy datasets for the signatures of binary pulsars with approximately linear acceleration. In this paper we will explore how we have reduced the energy cost of an SKA-like implementation of FDAS in AstroAccelerate, utilising a combination of mixed-precision computing and dynamic frequency scaling on NVIDIA GPUs. Combining the two approaches, we have managed to save 58% of the overall energy cost of FDAS with a (<3%) sacrifice in numerical sensitivity.

研究动机与目标

  • 降低FDAS的能耗,FDAS是用于在时域射电天文数据集中检测双星脉冲星的一种计算密集型方法。
  • 应对SKA等下一代射电望远镜日益增长的能耗需求,这些望远镜需要对海量数据进行实时处理。
  • 通过优化GPU工作负载实现精度降低与时钟频率调节,探索传统高性能计算的能效更优替代方案。
  • 在最小化功耗的同时保持数值灵敏度,从而减少数据中心规模天文计算设施的二氧化碳排放。

提出的方法

  • 通过将FDAS中最计算密集的卷积阶段转换为bfloat16,采用混合精度计算,减少内存占用和数据移动量。
  • 在FDAS执行期间应用动态频率调节,降低GPU核心时钟频率,从而减少功耗,尽管执行时间有所增加。
  • 采用类似SKA的配置(600秒观测时间,64微秒时间分辨率,5925个DM试验,193个加速度试验)以实现真实的性能评估。
  • 使用NVIDIA A100和RTX 4090 GPU,测量不同GPU频率和精度级别下的能耗与时间权衡。
  • 评估精度降低对数值灵敏度的影响,发现检测强度幅度的最大误差为2.7%。
  • 结合两种技术,评估其在能效与性能方面的协同效应。

实验结果

研究问题

  • RQ1使用bfloat16的混合精度计算是否能在不显著降低检测灵敏度的情况下减少FDAS的能耗?
  • RQ2在带宽受限的工作负载中,动态频率调节是否比性能提升更有效地降低GPU功耗,从而实现净能耗节省?
  • RQ3在FDAS中结合混合精度与动态频率调节时,执行时间与能耗使用之间的最佳平衡点是什么?
  • RQ4在这些优化下,新型GPU架构(如A100、RTX 4090)在FDAS中的能效表现如何比较?
  • RQ5在SKA规模的FDAS工作负载中,能在保持可接受灵敏度与性能的前提下实现多大程度的能耗节省?

主要发现

  • 通过在NVIDIA A100 GPU上结合使用bfloat16的混合精度计算与动态频率调节,实现了58%的能耗降低。
  • bfloat16转换在卷积阶段引入的最大数值误差为检测强度幅度的2.7%,导致灵敏度损失小于3%。
  • 能耗节省在较低GPU时钟频率下达到最大,尽管执行时间增加,表明带宽受限的工作负载从降低时钟速度中受益。
  • 速度与能效之间的权衡在高频下表现出收益递减,证实了FDAS的带宽受限特性。
  • 仅使用动态频率调节即可显著降低功耗,最高效的配置出现在较低频率下,尽管执行时间更长。
  • 两种技术的结合产生了协同效应,能耗节省效果优于单独使用任一方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。