[论文解读] A Simple Model for Portable and Fast Prediction of Execution Time and Power Consumption of GPU Kernels
该论文提出了一种可移植、快速且准确的机器学习模型,仅使用硬件无关特征(如指令计数和内核启动配置)来预测GPU内核的执行时间和功耗,而无需依赖硬件特定指标。该模型基于来自主要基准测试的189个内核的随机森林训练,在五种不同GPU上,执行时间的中位数MAPE为8.86–52.0%,功耗的中位数MAPE为1.84–2.94%,单次预测延迟低于109毫秒。
Characterizing compute kernel execution behavior on GPUs for efficient task scheduling is a non-trivial task. We address this with a simple model enabling portable and fast predictions among different GPUs using only hardware-independent features. This model is built based on random forests using 189 individual compute kernels from benchmarks such as Parboil, Rodinia, Polybench-GPU and SHOC. Evaluation of the model performance using cross-validation yields a median Mean Average Percentage Error (MAPE) of 8.86-52.00% and 1.84-2.94%, for time respectively power prediction across five different GPUs, while latency for a single prediction varies between 15 and 108 milliseconds.
研究动机与目标
- 在不依赖硬件特定指标的前提下,实现在不同GPU架构上可移植且快速预测GPU内核性能。
- 解决GPGPU工作负载中缺乏可泛化且公开可用的性能与功耗模型的问题。
- 开发一种仅使用静态硬件无关特征(如指令计数和内核启动参数)的模型。
- 支持异构计算环境中高效的任务调度、系统资源配置和面向能效的工作负载部署。
- 提升性能模型在GPU之间的可移植性和可重用性,尤其适用于消费级和企业级设备。
提出的方法
- 该模型使用随机森林学习硬件无关特征与执行时间/功耗之间的映射关系。
- 特征包括不同地址空间中的浮点、整数和内存操作计数,以及线程层次结构和启动配置参数。
- 训练数据源自Parboil、Rodinia、Polybench-GPU和SHOC等基准测试中的189个唯一GPU内核。
- 通过交叉验证评估模型在五种不同GPU架构(K20、Titan Xp、P100、V100和GTX1650)上的泛化能力。
- 模型排除了缓存命中率等硬件依赖特征,确保在不同GPU代际间的可移植性。
- 预测延迟测量为每内核15–108毫秒,支持在调度系统中实现实时或近实时应用。
实验结果
研究问题
- RQ1是否可以仅使用硬件无关特征准确预测GPU内核的执行时间和功耗?
- RQ2单一模型在未重新训练的情况下,跨多种不同GPU架构的泛化能力如何?
- RQ3内核执行时长和启动配置对预测精度有何影响?
- RQ4与企业级GPU相比,该模型在具有动态频率调节的消费级GPU上的表现如何?
- RQ5该模型能否支持实际应用场景,如异构计算环境中的任务调度和系统资源配置?
主要发现
- 在P100 GPU上,该模型对执行时间预测的中位数MAPE为8.86%,范围在10.89%(V100)至52.0%(GTX1650)之间。
- 所有五款GPU上的功耗预测中位数MAPE为1.84–2.94%,表明预测精度高且鲁棒性强。
- GTX1650作为一款具有动态频率调节的消费级GPU,其时间预测误差最高(中位数MAPE为52.0%),可能由于训练数据中长运行内核的代表性不足。
- 该模型在所有GPU上均保持较低的功耗预测误差(MAPE为1.84–2.94%),表明其在功耗指标上具有强大的泛化能力。
- 单次预测耗时15–108毫秒,支持在运行时调度系统中实际部署。
- 该模型已公开可用,可针对新型GPU架构重新训练,支持在CUDA设备间的可移植性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。