Skip to main content
QUICK REVIEW

[论文解读] Optimizing performance per watt on GPUs in High Performance Computing: temperature, frequency and voltage effects

Danny C. Price, M. A. Clark|arXiv (Cornell University)|Jul 30, 2014
Satellite Communication Systems参考文献 20被引用 9
一句话总结

本文展示了通过在NVIDIA K20 GPU上降低供电电压并提高时钟频率(在低温芯片状态下)可将GPU的每瓦性能提升高达48%。该方法利用温度感知的电压与频率动态调节(T-DVFS),利用了物理晶体管行为特性,表明动态功耗与电压和温度呈平方关系,从而在高性能计算(HPC)和射电天文工作负载中实现显著的节能效果。

ABSTRACT

The magnitude of the real-time digital signal processing challenge attached to large radio astronomical antenna arrays motivates use of high performance computing (HPC) systems. The need for high power efficiency (performance per watt) at remote observatory sites parallels that in HPC broadly, where efficiency is an emerging critical metric. We investigate how the performance per watt of graphics processing units (GPUs) is affected by temperature, core clock frequency and voltage. Our results highlight how the underlying physical processes that govern transistor operation affect power efficiency. In particular, we show experimentally that GPU power consumption grows non-linearly with both temperature and supply voltage, as predicted by physical transistor models. We show lowering GPU supply voltage and increasing clock frequency while maintaining a low die temperature increases the power efficiency of an NVIDIA K20 GPU by up to 37-48% over default settings when running xGPU, a compute-bound code used in radio astronomy. We discuss how temperature-aware power models could be used to reduce power consumption for future HPC installations. Automatic temperature-aware and application-dependent voltage and frequency scaling (T-DVFS and A-DVFS) may provide a mechanism to achieve better power efficiency for a wider range of codes running on GPUs

研究动机与目标

  • 研究温度、电压和时钟频率对基于GPU的HPC系统每瓦性能的影响。
  • 应对在功耗预算受限的百亿亿次计算和远程天文台部署中所面临的功率效率关键挑战。
  • 评估动态电压与频率调节(DVFS)对GPU功耗效率的影响,特别是在受控热环境下的表现。
  • 证明在低温芯片状态下降低供电电压并提高时钟频率可显著提升每瓦性能。
  • 倡导在HPC系统中集成温度感知与应用相关的DVFS(T-DVFS与A-DVFS),以提升全系统能效。

提出的方法

  • 在保持受控芯片温度的条件下,测量NVIDIA K20 GPU在不同核心时钟频率和供电电压下的每瓦性能。
  • 使用水冷系统实现并维持低温芯片温度(低至30°C),从而在不触发热节流的情况下实现更低电压运行。
  • 应用xGPU代码——一种计算密集型的射电天文互相关核函数——以评估不同电压与频率设置下的性能与功耗。
  • 将系统功耗建模为动态功耗与静态功耗(漏电流)之和,其中动态功耗与电压和频率的平方成正比。
  • 提出系统级效率指标 η_pow = N_OPS / (P_sys + P_cool + ...),以优化包含冷却功耗在内的整个系统的每瓦性能。
  • 通过对比水冷与原厂风冷的功耗表现,评估冷却系统效率的影响,结果表明水冷可降低基础设施功耗。

实验结果

研究问题

  • RQ1在受控温度条件下,供电电压和核心时钟频率如何影响GPU的每瓦性能?
  • RQ2在保持低温芯片状态的前提下,通过降低电压并提高频率,每瓦性能最多可提升多少?
  • RQ3在效率指标中纳入冷却系统功耗后,对实现每瓦性能最大化的最优配置有何影响?
  • RQ4温度在实现更低电压运行和提升GPU架构功耗效率方面起到什么作用?
  • RQ5温度感知与应用相关的电压与频率动态调节(T-DVFS与A-DVFS)是否可用于自动优化多样化HPC工作负载的功耗效率?

主要发现

  • 当芯片温度保持在30°C时,NVIDIA K20 GPU的每瓦性能最高可提升48%,前提是供电电压降低且时钟频率提高。
  • 动态功耗与供电电压和温度均呈平方关系,与物理晶体管模型一致。
  • 包含冷却功耗的系统级每瓦性能指标表明,较低的芯片温度可通过支持更低电压运行来提升整体效率。
  • 水冷相比原厂风冷显著降低了基础设施功耗,从而提升了整个系统的净能效。
  • 本研究发现与以往数据中心关于较高冷却液温度的结论存在差异:与关注PUE的一般数据中心不同,HPC系统因电压调节而受益于更低温度,而PUE本身无法反映这一优势。
  • 针对特定应用且具备温度感知能力的动态电压与频率调节(T-DVFS)可显著提升功耗效率,通过根据热状态和工作负载条件自动调节电压与频率实现优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。