Skip to main content
QUICK REVIEW

[论文解读] Improved Acceleration of the GPU Fourier Domain Acceleration Search Algorithm

Karel Adámek, Sofia Dimoudi|arXiv (Cornell University)|Nov 29, 2017
Radio Astronomy Observations and Technology被引用 7
一句话总结

本论文提出了一种针对GPU的傅里叶域加速搜索(FDAS)算法优化实现,采用自定义FFT内核和改进的卷积例程,相较于先前最佳实现提升44%性能,并在NVIDIA P100上实现高达3.9倍于cuFFT方法的加速。性能提升源于线程级数据重用增强、shuffle指令减少以及每线程FFT元素增加,从而实现更大滤波器尺寸和更高的射电天文信号处理计算效率。

ABSTRACT

We present an improvement of our implementation of the Correlation Technique for the Fourier Domain Acceleration Search (FDAS) algorithm on Graphics Processor Units (GPUs) (Dimoudi & Armour 2015; Dimoudi et al. 2017). Our new improved convolution code which uses our custom GPU FFT code is between 2.5 and 3.9 times faster the than our cuFFT-based implementation (on an NVIDIA P100) and allows for a wider range of filter sizes then our previous version. By using this new version of our convolution code in FDAS we have achieved 44% performance increase over our previous best implementation. It is also approximately 8 times faster than the existing PRESTO GPU implementation of FDAS (Luo 2013). This work is part of the AstroAccelerate project (Armour et al. 2002), a many-core accelerated time-domain signal processing library for radio astronomy.

研究动机与目标

  • 加速傅里叶域加速搜索(FDAS)算法,以在射电天文数据中检测双星脉冲星。
  • 通过优化GPU上的FFT和卷积内核,克服卷积操作中的性能瓶颈。
  • 通过改进内存访问和计算效率,扩展FDAS中可用滤波器尺寸的范围。
  • 通过提升GPU内核性能,降低大规模射电望远镜数据处理中的计算成本和能耗。

提出的方法

  • 开发了自定义GPU FFT内核,通过每线程计算多个FFT元素,提升数据重用并减少冗余旋转因子计算。
  • 利用GPU shuffle指令加速线 within warp 的数据交换,降低同步开销,提升小FFT尺寸(N ≤ 32)下的性能。
  • 应用重叠-保存方法将长时间序列分割为独立段落进行卷积,实现高效的GPU并行化。
  • 通过使用共享内存并最小化全局内存访问,优化卷积内核,使其成为带宽受限而非计算受限。
  • 将优化后的FFT和卷积例程集成至FDAS流水线,利用算法特定对称性进一步减少寄存器使用并提升占用率。
  • 在不同滤波器长度和GPU架构(P100、TITAN X)上进行性能基准测试,对比cuFFT和先前自定义FFT实现。

实验结果

研究问题

  • RQ1如何通过低层级优化FFT和卷积内核,提升基于GPU的FDAS算法性能?
  • RQ2在FDAS背景下,具备增强数据重用和shuffle指令使用的自定义GPU FFT内核,相较于标准cuFFT库能实现多大程度的性能超越?
  • RQ3每线程计算的FFT元素数量增加,对内核占用率和整体性能有何影响?
  • RQ4优化后的卷积内核是否能在保持高吞吐量的同时支持更大的滤波器尺寸?这对加速脉冲星检测灵敏度有何影响?

主要发现

  • 与前一版本相比,新自定义FFT内核在P100上实现20%性能提升,在TITAN X上实现50%性能提升。
  • 使用新FFT内核的优化卷积代码相较于先前最佳FDAS实现,性能提升44%。
  • 新实现相较于NVIDIA P100上的cuFFT实现,最高实现3.9倍加速。
  • 优化代码将最大滤波器尺寸扩展至2048个元素,支持更长的匹配滤波器并提升检测灵敏度。
  • 使用共享内存的卷积内核变为共享内存带宽受限,减少对全局内存的依赖,提升效率。
  • 由于算法特定优化(如减少寄存器使用和提高内核占用率),性能增益在完整FDAS流水线中进一步放大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。