Skip to main content
QUICK REVIEW

[论文解读] Performance Prediction for Convolutional Neural Networks in Edge Devices

Halima Bouzidi, Hamza Ouarnoughi|arXiv (Cornell University)|Oct 21, 2020
Advanced Neural Network Applications参考文献 16被引用 5
一句话总结

本文评估了五种机器学习模型——OLS、MLP、SVR、随机森林(Random Forest)和XGBoost——在边缘GPU平台上预测卷积神经网络(CNN)推理执行时间的性能。XGBoost在未见过的网络架构上仍保持平均预测误差低于14.73%,在准确性、训练效率和推理延迟方面均优于其他模型,展现出最佳的综合平衡。

ABSTRACT

Running Convolutional Neural Network (CNN) based applications on edge devices near the source of data can meet the latency and privacy challenges. However due to their reduced computing resources and their energy constraints, these edge devices can hardly satisfy CNN needs in processing and data storage. For these platforms, choosing the CNN with the best trade-off between accuracy and execution time while respecting Hardware constraints is crucial. In this paper, we present and compare five (5) of the widely used Machine Learning based methods for execution time prediction of CNNs on two (2) edge GPU platforms. For these 5 methods, we also explore the time needed for their training and tuning their corresponding hyperparameters. Finally, we compare times to run the prediction models on different platforms. The utilization of these methods will highly facilitate design space exploration by providing quickly the best CNN on a target edge GPU. Experimental results show that eXtreme Gradient Boosting (XGBoost) provides a less than 14.73% average prediction error even for unexplored and unseen CNN models' architectures. Random Forest (RF) depicts comparable accuracy but needs more effort and time to be trained. The other 3 approaches (OLS, MLP and SVR) are less accurate for CNN performances estimation.

研究动机与目标

  • 通过在设计早期阶段实现推理执行时间的快速预测,支持在资源受限的边缘设备上对CNN进行快速设计空间探索。
  • 识别适用于边缘GPU平台CNN性能预测的最准确、高效且可扩展的机器学习模型。
  • 评估多种机器学习模型在预测准确性、模型训练时间、超参数调优成本和推理延迟之间的权衡。
  • 评估预测模型在不同边缘GPU平台(NVIDIA AGX与TX2)上的泛化能力。

提出的方法

  • 提取20个CNN架构特征(如深度、宽度、卷积核大小、FLOPs、参数量)作为性能预测的输入。
  • 训练五种回归模型:普通最小二乘法(OLS)、多层感知机(MLP)、支持向量回归(SVR)、随机森林(RF)和极端梯度提升(XGBoost)。
  • 在NVIDIA AGX和TX2边缘GPU上均使用网格搜索进行超参数调优,训练数据来自对100多个CNN的性能分析。
  • 在三个评估空间中测量并比较模型性能:NIS(新、未见过的结构)、NCV(新、已验证的)、NCA(新、增强的)CNN。
  • 在AGX、TX2和CPU工作站上评估每种模型的预测延迟,以评估其在设计探索中的实时可用性。
  • 使用平均绝对百分比误差(MAPE)报告结果,以量化预测准确性,并在不同模型和平台之间进行比较。

实验结果

研究问题

  • RQ1在未见过的CNN架构上,哪种机器学习模型能为边缘GPU上的CNN推理时间提供最准确的预测?
  • RQ2在实际应用中,五种模型的训练时间、超参数调优成本和推理延迟如何比较?
  • RQ3当模型泛化到未训练过的新型CNN架构时,其预测准确性是否会显著下降?
  • RQ4在不重新训练的情况下,训练好的模型在不同边缘GPU平台(如AGX与TX2)之间的可迁移性如何?
  • RQ5这些模型能否在边缘设备上CNN部署的实时设计空间探索中被高效使用?

主要发现

  • XGBoost在所有测试集上均实现了低于14.73%的平均预测误差,包括在未探索和未见过的CNN架构(NCA空间)上。
  • 随机森林(RF)的准确性与XGBoost相当,但其训练和调优所需的时间与精力显著更多,因此在快速设计探索中实用性较低。
  • OLS的MAPE值最高,因其无法有效建模CNN特征与执行时间之间的复杂非线性关系。
  • SVR和MLP的准确性低于XGBoost和RF,其中SVR表现出较高的MAPE方差,并对核函数类型和C超参数值高度敏感。
  • XGBoost在预测准确性(NIS和NCV空间达92%)、超参数调优复杂度和推理延迟之间实现了最佳综合平衡,其推理速度优于所有其他模型。
  • 预测模型在NVIDIA AGX和TX2平台上的表现相似,表明其具备强大的跨平台泛化潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。