Skip to main content
QUICK REVIEW

[论文解读] Power Consumption Modeling and Prediction in a Hybrid CPU-GPU-MIC Supercomputer (preliminary version)

Alina Sîrbu, Özalp Babaoğlu|arXiv (Cornell University)|Jan 22, 2016
Parallel Computing and Optimization Techniques参考文献 12被引用 3
一句话总结

本文提出了一种基于历史作业轨迹和支持向量回归(SVR)的混合CPU-GPU-MIC超级计算机数据驱动功耗建模框架。通过利用应用程序名称、资源使用情况和作业时长等作业级特征,该方法实现了超过80%的用户特定作业功耗预测准确率,支持实时功耗感知调度与计费,且无需低层系统监控或代码分析。

ABSTRACT

Power consumption is a major obstacle for High Performance Computing (HPC) systems in their quest towards the holy grail of ExaFLOP performance. Significant advances in power efficiency have to be made before this goal can be attained and accurate modeling is an essential step towards power efficiency by optimizing system operating parameters to match dynamic energy needs. In this paper we present a study of power consumption by jobs in Eurora, a hybrid CPU-GPU-MIC system installed at the largest Italian data center. Using data from a dedicated monitoring framework, we build a data-driven model of power consumption for each user in the system and use it to predict the power requirements of future jobs. We are able to achieve good prediction results for over 80% of the users in the system. For the remaining users, we identify possible reasons why prediction performance is not as good. Possible applications for our predictive modeling results include scheduling optimization, power-aware billing and system-scale power modeling. All the scripts used for the study have been made available on GitHub.

研究动机与目标

  • 为解决ExaFLOP规模HPC系统中的能效关键挑战,实现作业功耗的精确预测。
  • 开发一种以用户为中心、无需应用代码或低层系统监控的、数据驱动的功耗建模方法。
  • 通过预测分析支持功耗感知调度、计费和系统级功耗建模。
  • 识别并验证影响混合CPU-GPU-MIC架构中功耗的关键作业级特征。
  • 实现实时部署功耗预测模型,并通过定期再训练实现自适应能力。

提出的方法

  • 本研究使用Eurora超级计算机以5秒为间隔收集的历史作业轨迹,提取作业级特征,如应用程序名称、使用的CPU/GPU/MIC数量以及作业时长。
  • 将功耗建模为回归问题,采用支持向量回归(SVR)方法,基于每位用户的作业历史数据独立训练模型。
  • 通过每5分钟对节点上的功耗进行求和,计算组件级功耗(CPU、GPU、MIC),总作业功耗为各组件功耗之和。
  • 框架使用scikit-learn进行训练,使用Google BigQuery进行初始数据分析验证,所有脚本已在GitHub上开源。
  • 为每位用户使用多SVR模型以捕捉其个体使用模式,性能优于仅考虑组件数量的基线增强平均模型(EAM)。
  • 通过离线训练模型并每月更新,实现实时预测;由于采用按用户并行化,计算开销较低。

实验结果

研究问题

  • RQ1仅使用高层作业特征和历史数据,能否在混合CPU-GPU-MIC超级计算机中准确预测作业功耗?
  • RQ2在异构HPC系统中,除组件数量外,哪些作业级特征对功耗影响最为显著?
  • RQ3与应用级或基于平均值的建模相比,用户特定建模在预测准确率方面表现如何?
  • RQ4数据质量和变异性在多大程度上影响功耗预测模型的性能?
  • RQ5所提出的框架能否实现实时部署,用于功耗感知调度和系统级功耗建模?

主要发现

  • 所提出的基于SVR的用户特定模型在80%的用户中预测误差低于20%,显著优于增强平均模型(EAM)。
  • 引入应用程序名称、作业时长以及其它作业的并发资源使用情况作为特征,可使预测准确率超越仅依赖组件数量的模型。
  • 20%用户的模型性能下降主要由于数据噪声,以及作业命名或资源使用模式不一致。
  • 该框架计算效率高:所有用户的全局模型训练仅需2.92核心小时,全月数据的推理时间仅需6.81分钟(跨所有用户)。
  • 该方法具备可扩展性和可并行化特性,每月在多核集群上重新训练模型仅需约3小时,适用于大规模HPC系统。
  • 该方法可支持实际应用,如功耗感知调度、系统级功耗建模,以及用户侧功耗估算,用于计费和资源规划。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。