Skip to main content
QUICK REVIEW

[论文解读] Techniques and tools for measuring energy efficiency of scientific software applications

David Abdurachmanov, P. Elmer|arXiv (Cornell University)|Oct 10, 2014
Parallel Computing and Optimization Techniques参考文献 15被引用 10
一句话总结

本文提出了一套全面的技术与工具,用于测量科学高性能计算(HPC)/高吞吐量计算(HTC)工作负载中的能效,重点比较了基于硬件传感器和软件性能分析的ARMv7与x86-64架构。本文扩展了开源IgProf性能分析器,通过RAPL实现了函数级别的能效分析,表明在配备服务器级系统的支持下,ARMv7在能效型科学计算方面展现出巨大潜力。

ABSTRACT

The scale of scientific High Performance Computing (HPC) and High Throughput Computing (HTC) has increased significantly in recent years, and is becoming sensitive to total energy use and cost. Energy-efficiency has thus become an important concern in scientific fields such as High Energy Physics (HEP). There has been a growing interest in utilizing alternate architectures, such as low power ARM processors, to replace traditional Intel x86 architectures. Nevertheless, even though such solutions have been successfully used in mobile applications with low I/O and memory demands, it is unclear if they are suitable and more energy-efficient in the scientific computing environment. Furthermore, there is a lack of tools and experience to derive and compare power consumption between the architectures for various workloads, and eventually to support software optimizations for energy efficiency. To that end, we have performed several physical and software-based measurements of workloads from HEP applications running on ARM and Intel architectures, and compare their power consumption and performance. We leverage several profiling tools (both in hardware and software) to extract different characteristics of the power use. We report the results of these measurements and the experience gained in developing a set of measurement techniques and profiling tools to accurately assess the power consumption for scientific workloads.

研究动机与目标

  • 为应对大规模科学计算中日益增长的能耗问题,特别是高能物理(HEP)和HPC/HTC工作负载中的能耗问题。
  • 开发并验证在不同硬件架构(尤其是ARMv7和Intel x86-64)上准确测量功耗的技术。
  • 扩展IgProf性能分析器,增加对x86和ARM架构的函数级别能效分析功能,支持软件层面的能效优化。
  • 通过真实HEP工作负载(如CMS)比较ARMv7与x86-64处理器的能效,并识别架构层面的权衡。
  • 为研究人员提供一套基于硬件和软件的测量方法工具包,用于评估和优化科学应用中的能耗。

提出的方法

  • 利用板载电源监控芯片(如TI INA231)和Intel的RAPL接口,对CPU、内存和系统组件实现细粒度的能耗测量。
  • 使用外部电源表(如钳形表、插电式电表)进行粗粒度的节点级能耗监测,精度达到亚百分之一,时间分辨率达秒级。
  • 在IgProf中实现基于统计采样的能效分析模块,利用PAPI读取RAPL数据,实现函数级别的能耗成本估算。
  • 在真实系统上运行CMS工作负载,开展物理测量,比较ARMv7与x86-64架构在能耗和性能方面的差异。
  • 使用STREAM基准测试验证能效分析模块,关联Add、Copy、Triad和Scale等函数的执行时间与能耗。
  • 结合开始/停止时间的采样技术,以最小性能开销估算平均功耗。

实验结果

研究问题

  • RQ1在运行代表性HEP工作负载时,ARMv7处理器的能耗与x86-64处理器相比如何?
  • RQ2现有硬件监控接口(如RAPL、板载传感器)在多大程度上能为科学应用提供准确且细粒度的能耗测量?
  • RQ3像IgProf这样的软件性能分析工具能否有效扩展以支持ARM架构(包括64位ARM)的函数级别能效分析?
  • RQ4在科学基准测试中,执行时间与能耗之间存在何种相关性?这一相关性如何指导优化策略?
  • RQ5在评估多样化HPC/HTC系统组件的能效时,面临哪些实际挑战和测量权衡?

主要发现

  • ARMv7处理器在内存密集型工作负载中表现出与x86-64相当的能效,表明其在未来的节能型HTC系统中具有应用潜力。
  • 在STREAM基准测试中,处理器封装和电源平面0(CPU核心)的能耗与执行时间高度一致,而电源平面1(GPU)的能耗几乎恒定,表明其能耗极低。
  • IgProf能效分析模块成功利用RAPL数据捕捉了函数级别的能耗成本,结果显示单线程基准测试中执行时间与能耗之间存在强烈相关性。
  • 基于硬件的监控(使用RAPL和板载传感器)实现了毫秒级精度和高准确性,适用于详细的系统级能耗分析。
  • 将能效分析集成到IgProf中,使研究人员能够识别科学代码中能耗较高的函数,从而支持针对性的能效优化。
  • 本研究证实,只要围绕该架构构建服务器级系统以确保可靠性和性能,ARMv7可作为科学计算中x86-64的可行替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。