Skip to main content
QUICK REVIEW

[論文レビュー] Performance Prediction for Convolutional Neural Networks in Edge Devices

Halima Bouzidi, Hamza Ouarnoughi|arXiv (Cornell University)|Oct 21, 2020
Advanced Neural Network Applications参考文献 16被引用数 5
ひとこと要約

この論文は、エッジGPUプラットフォームにおける畳み込みニューラルネットワーク(CNN)の推論実行時間の予測に、OLS、MLP、SVR、ランダムフォレスト、XGBoostの5つの機械学習モデルを評価している。XGBoostは、未学習のアーキテクチャに対しても14.73%未満の平均予測誤差を達成し、精度、トレーニング効率、推論遅延の観点で他を上回った。

ABSTRACT

Running Convolutional Neural Network (CNN) based applications on edge devices near the source of data can meet the latency and privacy challenges. However due to their reduced computing resources and their energy constraints, these edge devices can hardly satisfy CNN needs in processing and data storage. For these platforms, choosing the CNN with the best trade-off between accuracy and execution time while respecting Hardware constraints is crucial. In this paper, we present and compare five (5) of the widely used Machine Learning based methods for execution time prediction of CNNs on two (2) edge GPU platforms. For these 5 methods, we also explore the time needed for their training and tuning their corresponding hyperparameters. Finally, we compare times to run the prediction models on different platforms. The utilization of these methods will highly facilitate design space exploration by providing quickly the best CNN on a target edge GPU. Experimental results show that eXtreme Gradient Boosting (XGBoost) provides a less than 14.73% average prediction error even for unexplored and unseen CNN models' architectures. Random Forest (RF) depicts comparable accuracy but needs more effort and time to be trained. The other 3 approaches (OLS, MLP and SVR) are less accurate for CNN performances estimation.

研究の動機と目的

  • リソース制限のあるエッジデバイスにおけるCNNの迅速なデザインスケープ探索を可能にするために、設計プロセスの初期段階で推論実行時間を予測すること。
  • エッジGPUプラットフォームにおけるCNNパフォーマンス予測に最も正確で効率的かつスケーラブルな機械学習モデルを特定すること。
  • 複数のMLモデル間で、予測精度、モデルトレーニング時間、ハイパーパramータチューニングコスト、推論遅延のトレードオフを評価すること。
  • 異なるエッジGPUプラットフォーム(NVIDIA AGXとTX2)間での予測モデルの一般化性能を評価すること。

提案手法

  • パフォーマンス予測の入力として、20のCNNアーキテクチャ特徴量(例:深さ、幅、カーネルサイズ、FLOPs、パラメータ数)を抽出した。
  • 5つの回帰モデルをトレーニング:通常最小二乗法(OLS)、マルチレイヤーパーセプトロン(MLP)、サポートベクターレグレッション(SVR)、ランダムフォレスト(RF)、eXtreme Gradient Boosting(XGBoost)。
  • NVIDIA AGXおよびTX2エッジGPUの両方でグリッドサーチを用いてハイパーパramータチューニングを行い、100以上のCNNからのプロファイリングから得たトレーニングデータを活用した。
  • NIS(新規、未検証構造)、NCV(新規、検証済み)、NCA(新規、拡張済み)の3つの評価空間におけるモデル性能を測定・比較した。
  • AGX、TX2、およびCPUワークステーションでの各モデルの予測遅延を評価し、デザインスケープ探索におけるリアルタイム利用可能性を検証した。
  • 予測精度を数量化するために平均絶対誤差率(MAPE)を報告し、モデルおよびプラットフォーム間で比較した。

実験結果

リサーチクエスチョン

  • RQ1未学習のアーキテクチャに適用した場合、どの機械学習モデルがエッジGPU上のCNNの推論実行時間予測において最も正確か?
  • RQ2実際の運用において、5つのモデルのトレーニング時間、ハイパーパramータチューニングコスト、推論遅延はどのように比較されるか?
  • RQ3未学習のCNNアーキテクチャに一般化する際、モデルの予測精度は著しく低下するか?
  • RQ4再トレーニングなしで、AGXとTX2などの異なるエッジGPUプラットフォーム間で、トレーニング済みモデルの適合性はどの程度高いか?
  • RQ5これらのモデルは、エッジデバイスへのCNNデプロイメントのためのリアルタイムデザインスケープ探索に効率的に利用可能か?

主な発見

  • XGBoostは、NCA空間を含むすべてのテストセットで14.73%未満の平均予測誤差を達成し、最も低い誤差を示した。
  • ランダムフォレスト(RF)はXGBoostと同等の精度を示したが、トレーニングおよびチューニングにははるかに時間がかかり、迅速なデザインスケープ探索には不適切であった。
  • OLSは、CNN特徴量と実行時間の間の複雑な非線形関係をモデル化できないため、最も高いMAPE値を示した。
  • SVRとMLPはXGBoostおよびRFほど正確ではなく、SVRはMAPEのばらつきが大きく、カーネルタイプやCハイパーパramータ値に敏感であった。
  • XGBoostは、予測精度(NISおよびNCVで92%)、ハイパーパramータチューニングの複雑さ、推論遅延の観点で、他のすべてのモデルを上回る包括的なトレードオフを実現した。
  • 予測モデルは、NVIDIA AGXおよびTX2の両プラットフォームで同様の性能を示し、強力なクロスプラットフォーム一般化可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。