Skip to main content
QUICK REVIEW

[论文解读] GPGPU Performance Estimation with Core and Memory Frequency Scaling

Qiang Wang, Xiaowen Chu|arXiv (Cornell University)|Jan 19, 2017
Parallel Computing and Optimization Techniques参考文献 20被引用 6
一句话总结

本文提出了一种快速且准确的解析模型,用于在动态核心频率和内存频率调节下估算GPU内核执行时间,采用先到先服务(FCFS)内存队列模型并仅需最少的微基准测试。该模型在12个真实GPU内核的49种频率设置下实现了3.5%的平均绝对百分比误差(MAPE),展示了在面向能效的DVFS优化中具有高精度和低方差的特性。

ABSTRACT

Graphics Processing Units (GPUs) support dynamic voltage and frequency scaling (DVFS) in order to balance computational performance and energy consumption. However, there still lacks simple and accurate performance estimation of a given GPU kernel under different frequency settings on real hardware, which is important to decide best frequency configuration for energy saving. This paper reveals a fine-grained model to estimate the execution time of GPU kernels with both core and memory frequency scaling. Over a 2.5x range of both core and memory frequencies among 12 GPU kernels, our model achieves accurate results (within 3.5\%) on real hardware. Compared with the cycle-level simulators, our model only needs some simple micro-benchmark to extract a set of hardware parameters and performance counters of the kernels to produce this high accuracy.

研究动机与目标

  • 解决在动态电压频率调节(DVFS)下GPU内核缺乏准确、实时性能估算的问题。
  • 克服周期级模拟器在现代GPU架构中速度慢且过时的局限性。
  • 开发一种轻量级模型,仅通过一次基线微基准测试即可预测在广泛核心与内存频率范围内的执行时间。
  • 通过准确建模核心与内存频率调节对GPU内核执行时间的影响,实现对能效性能的实时优化。

提出的方法

  • 将GPU内存系统建模为FCFS队列,其中服务速率取决于内存频率,以捕捉内存访问延迟与吞吐量。
  • 通过将计算密集型执行时间建模为与核心频率成反比,整合核心频率调节的影响。
  • 使用在700 MHz(核心与内存)下运行的单个基线微基准测试,提取性能计数器和硬件参数。
  • 基于指令类型分布与内存访问模式,采用加权和方法结合核心与内存时间估计。
  • 利用内核特定的性能分析数据对模型进行校准,以考虑L2缓存效应与共享内存访问模式的影响。
  • 在NVIDIA GTX980上通过真实硬件测量,对49种频率组合(最高达2.5倍调节)验证模型性能。

实验结果

研究问题

  • RQ1轻量级解析模型在广泛的核心与内存频率设置下,能否准确预测GPU内核执行时间?
  • RQ2所提出的模型在多大程度上能够捕捉核心与内存频率调节对多样化GPU内核性能影响?
  • RQ3该模型是否能在不依赖周期级模拟或大量训练数据的情况下实现高精度?
  • RQ4该模型在不同类型内核(包括内存密集型、计算密集型和缓存密集型工作负载)中的表现如何?

主要发现

  • 所提出的模型在真实硬件上对全部49种频率设置和12个GPU内核的MAPE为3.5%,表现出高精度。
  • 对于单个内核,MAPE范围为0.7%至6.9%,表明在多样化工作负载下具有低方差和一致的准确性。
  • 模型准确捕捉了DRAM密集型内核的性能扩展行为,对于高共享内存或L2缓存使用量的内核,预测误差略有上升。
  • 所有预测的误差均低于16%,其中90%的预测误差低于10%,展现出良好的鲁棒性。
  • 即使在核心与内存频率分别达到2.5倍调节的情况下,模型的精度依然保持稳定,表现出强大的泛化能力。
  • 指令分布分析表明,共享内存访问量高的内核中,低估误差最为显著,提示在共享内存延迟建模方面仍有优化空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。