Skip to main content
QUICK REVIEW

[论文解读] A Simple Model for Portable and Fast Prediction of Execution Time and Power Consumption of GPU Kernels

Lorenz Braun, Sotirios Nikas|arXiv (Cornell University)|Jan 20, 2020
Parallel Computing and Optimization Techniques被引用 6
一句话总结

该论文提出了一种可移植、快速且准确的机器学习模型,仅使用硬件无关特征(如指令计数和内核启动配置)来预测GPU内核的执行时间和功耗,而无需依赖硬件特定指标。该模型基于来自主要基准测试的189个内核的随机森林训练,在五种不同GPU上,执行时间的中位数MAPE为8.86–52.0%,功耗的中位数MAPE为1.84–2.94%,单次预测延迟低于109毫秒。

ABSTRACT

Characterizing compute kernel execution behavior on GPUs for efficient task scheduling is a non-trivial task. We address this with a simple model enabling portable and fast predictions among different GPUs using only hardware-independent features. This model is built based on random forests using 189 individual compute kernels from benchmarks such as Parboil, Rodinia, Polybench-GPU and SHOC. Evaluation of the model performance using cross-validation yields a median Mean Average Percentage Error (MAPE) of 8.86-52.00% and 1.84-2.94%, for time respectively power prediction across five different GPUs, while latency for a single prediction varies between 15 and 108 milliseconds.

研究动机与目标

  • 在不依赖硬件特定指标的前提下,实现在不同GPU架构上可移植且快速预测GPU内核性能。
  • 解决GPGPU工作负载中缺乏可泛化且公开可用的性能与功耗模型的问题。
  • 开发一种仅使用静态硬件无关特征(如指令计数和内核启动参数)的模型。
  • 支持异构计算环境中高效的任务调度、系统资源配置和面向能效的工作负载部署。
  • 提升性能模型在GPU之间的可移植性和可重用性,尤其适用于消费级和企业级设备。

提出的方法

  • 该模型使用随机森林学习硬件无关特征与执行时间/功耗之间的映射关系。
  • 特征包括不同地址空间中的浮点、整数和内存操作计数,以及线程层次结构和启动配置参数。
  • 训练数据源自Parboil、Rodinia、Polybench-GPU和SHOC等基准测试中的189个唯一GPU内核。
  • 通过交叉验证评估模型在五种不同GPU架构(K20、Titan Xp、P100、V100和GTX1650)上的泛化能力。
  • 模型排除了缓存命中率等硬件依赖特征,确保在不同GPU代际间的可移植性。
  • 预测延迟测量为每内核15–108毫秒,支持在调度系统中实现实时或近实时应用。

实验结果

研究问题

  • RQ1是否可以仅使用硬件无关特征准确预测GPU内核的执行时间和功耗?
  • RQ2单一模型在未重新训练的情况下,跨多种不同GPU架构的泛化能力如何?
  • RQ3内核执行时长和启动配置对预测精度有何影响?
  • RQ4与企业级GPU相比,该模型在具有动态频率调节的消费级GPU上的表现如何?
  • RQ5该模型能否支持实际应用场景,如异构计算环境中的任务调度和系统资源配置?

主要发现

  • 在P100 GPU上,该模型对执行时间预测的中位数MAPE为8.86%,范围在10.89%(V100)至52.0%(GTX1650)之间。
  • 所有五款GPU上的功耗预测中位数MAPE为1.84–2.94%,表明预测精度高且鲁棒性强。
  • GTX1650作为一款具有动态频率调节的消费级GPU,其时间预测误差最高(中位数MAPE为52.0%),可能由于训练数据中长运行内核的代表性不足。
  • 该模型在所有GPU上均保持较低的功耗预测误差(MAPE为1.84–2.94%),表明其在功耗指标上具有强大的泛化能力。
  • 单次预测耗时15–108毫秒,支持在运行时调度系统中实际部署。
  • 该模型已公开可用,可针对新型GPU架构重新训练,支持在CUDA设备间的可移植性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。