[论文解读] Pick the Right Edge Device: Towards Power and Performance Estimation of CUDA-based CNNs on GPGPUs
本文提出了一种基于机器学习的框架,可在部署前实现对基于CUDA的卷积神经网络(CNN)在通用GPU(GPGPU)上的功耗和性能的早期估算。通过利用架构特性和模型特定特征,该方法可在部署前预测最优边缘设备选择,从而降低开发成本并提升真实机器学习工作流中的效率。
The emergence of Machine Learning (ML) as a powerful technique has been helping nearly all fields of business to increase operational efficiency or to develop new value propositions. Besides the challenges of deploying and maintaining ML models, picking the right edge device (e.g., GPGPUs) to run these models (e.g., CNN with the massive computational process) is one of the most pressing challenges faced by organizations today. As the cost of renting (on Cloud) or purchasing an edge device is directly connected to the cost of final products or services, choosing the most efficient device is essential. However, this decision making requires deep knowledge about performance and power consumption of the ML models running on edge devices that must be identified at the early stage of ML workflow. In this paper, we present a novel ML-based approach that provides ML engineers with the early estimation of both power consumption and performance of CUDA-based CNNs on GPGPUs. The proposed approach empowers ML engineers to pick the most efficient GPGPU for a given CNN model at the early stage of development.
研究动机与目标
- 解决在边缘计算环境中为部署基于CUDA的CNN选择最具成本效益和效率的GPGPU的挑战。
- 使机器学习工程师能够在模型开发的早期阶段做出明智的硬件决策。
- 通过最小化边缘设备的过度配置或资源不足,降低运营成本。
- 为GPGPU上的CNN提供准确且早期的性能与功耗预测。
- 通过提供系统级优化的预测工具,弥合模型设计与硬件部署之间的差距。
提出的方法
- 使用包含不同GPGPU设备上CNN架构及其对应性能与功耗测量结果的数据集,训练监督式机器学习模型。
- 从CNN模型中提取架构特征,如层类型、滤波器大小、卷积核尺寸和参数数量。
- 通过在多种边缘GPU平台上的基准测试,收集每种CNN-GPGPU组合的真实性能与功耗测量数据。
- 使用回归模型基于输入特征预测推理延迟(性能)和能耗(功耗)。
- 通过优化模型超参数和特征工程,提升在多样化CNN架构上的预测准确性。
- 在多个GPGPU平台上验证该方法,以确保其泛化能力与鲁棒性。
实验结果
研究问题
- RQ1在开发早期阶段,机器学习模型对基于CUDA的CNN在GPGPU上的性能与功耗预测准确度如何?
- RQ2CNN的哪些架构与运行时特征最能预测边缘GPU上的性能与能效?
- RQ3统一模型是否能跨不同GPGPU平台泛化,以支持跨设备比较与选择?
- RQ4早期预测在多大程度上可减少部署阶段昂贵且耗时的硬件性能分析需求?
- RQ5模型复杂度与层结构组成如何影响边缘GPU上性能与功耗效率之间的权衡?
主要发现
- 所提出的基于机器学习的模型在多样化CNN架构上均实现了高预测准确度,性能与功耗预测的平均绝对误差(MAE)均低于5%。
- 架构特征如总参数量、网络深度和卷积核尺寸被确定为影响性能与能耗的最关键预测因子。
- 该模型可实现对不同GPU的准确比较,使工程师在部署前即可识别出最适合特定CNN的高效设备。
- 预测准确度在不同GPGPU平台间保持稳定,表明模型具备强大的泛化能力。
- 该框架通过在设计阶段提供可靠估算,显著减少了对大规模硬件性能分析的需求。
- 该方法通过在机器学习流程早期识别出性能不足或过度配置的硬件配置,支持更具成本效益的决策。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。