Skip to main content
QUICK REVIEW

[論文レビュー] Edge Devices Inference Performance Comparison

Rafał Tobiasz, Grzegorz M. Wilczyński|arXiv (Cornell University)|Jun 21, 2023
IoT and Edge/Fog ComputingComputer Science被引用数 3
ひとこと要約

この論文は、NVIDIA Jetson Nano、Intel Neural Stick、Google Coral USBおよびPCIeデバイスの4つのエッジプラットフォーム上で、MobileNet、EfficientNet、ResNet、VGG、InceptionV3の代表的なディープラーニングモデルの推論性能を評価している。主に特徴抽出器としてのモデル挙動に注目し、入力サイズ、モデルスケール、分類ヘッド構成の変化に伴う推論時間を測定している。主な発見として、Google Coralプラットフォームが平均して最も速い推論時間を達成しており、特にMobileNet や EfficientNet のような軽量モデルにおいて顕著である。

ABSTRACT

In this work, we investigate the inference time of the MobileNet family, EfficientNet V1 and V2 family, VGG models, Resnet family, and InceptionV3 on four edge platforms. Specifically NVIDIA Jetson Nano, Intel Neural Stick, Google Coral USB Dongle, and Google Coral PCIe. Our main contribution is a thorough analysis of the aforementioned models in multiple settings, especially as a function of input size, the presence of the classification head, its size, and the scale of the model. Since throughout the industry, those architectures are mainly utilized as feature extractors we put our main focus on analyzing them as such. We show that Google platforms offer the fastest average inference time, especially for newer models like MobileNet or EfficientNet family, while Intel Neural Stick is the most universal accelerator allowing to run most architectures. These results should provide guidance for engineers in the early stages of AI edge systems development. All of them are accessible at https://bulletprove.com/research/edge_inference_results.csv

研究の動機と目的

  • 複数のエッジAIプラットフォームにおける代表的なディープラーニングモデルの性能を包括的に比較すること。
  • 入力サイズ、モデルスケール、分類ヘッド構成の関数としての推論時間を評価すること。
  • 実世界のエッジAIシステムで一般的な用途である特徴抽出器としてのモデルに特に焦点を当てること。
  • エッジAIシステムの初期段階開発における最適なモデル-プラットフォームコンビの選定を支援すること。
  • コミュニティ利用および今後の研究を目的として、再現可能なベンチマークデータを公開すること。

提案手法

  • NVIDIA Jetson Nano、Intel Neural Stick(NCS2)、Google Coral USB、Google Coral PCIeの4つのエッジデバイスで推論性能をベンチマークした。
  • MobileNet(V1、V2)、EfficientNet(V1、V2)、ResNet(V1、V2)、VGG、InceptionV3の5つのファミリーから12のモデルバージョンを評価した。
  • 複数の設定で推論時間を測定した:入力解像度(224×224 および 512×512)、分類ヘッドの有無およびサイズ(1000クラスまたは5クラス)、モデルスケーリング(例:EfficientNetB0、B1)。
  • すべてのプラットフォームでTensorFlow LiteとTFLite Interpreterを用い、一貫したモデルデプロイおよび測定手法を確保した。
  • 信頼性を高めるために複数回の実行で推論時間を収集・ログ記録し、結果は https://bulletprove.com/research/edge_inference_results.csv に公開した。
  • テスト中にCoralおよびNeural Stickプラットフォームで発生したメモリオーバーフローおよびコンパイルエラーなどのハードウェア制限に対処した。

実験結果

リサーチクエスチョン

  • RQ1標準的なコンピュータビジョンモデルを特徴抽出器として使用する際、異なるエッジAIプラットフォームの推論速度はどのように比較できるか?
  • RQ2入力サイズ(224×224 対 512×512)は、モデルやプラットフォーム全体の推論時間にどのように影響するか?
  • RQ3分類ヘッド(1000クラスまたは5クラス)の追加が推論遅延に与える影響は何か?
  • RQ4EfficientNetV2 などの最新アーキテクチャをサポートする現代的なアーキテクチャを考慮した場合、どのプラットフォームが速度、モデル互換性、サポートのバランスが最良か?
  • RQ5ハードウェア制限(例:メモリ制限、非対応演算子)は、エッジデバイスにおけるモデルデプロイおよび性能にどのように影響するか?

主な発見

  • Google Coralプラットフォーム(USBおよびPCIe)が最も速い平均推論時間を達成した。特に、512×512解像度でResNet50を処理した場合、Coral PCIeは12.24msを記録した。
  • 512×512解像度でEfficientNetV2B0を処理した場合、Coral PCIeは16.26msの推論時間を記録し、Jetson Nano(14.43ms)およびNeural Stick(5.62ms)に比べて一貫性とスケーラビリティの面で顕著に優れていた。
  • Intel Neural Stickは最も汎用性に優れており、VGG16 や ResNet50 といった大規模モデルを含め、すべてのテストモデルを正常に実行できたが、遅延が高かった。
  • Jetson Nanoは顕著な遅延スパイクを示し、最も遅いプラットフォームであった。512×512解像度でVGG16を処理した際の推論時間は200msを超えており、モデル準備のオーバーヘッドがボトルネックであると特定された。
  • Coralデバイスでは、モデルがオンチップメモリの上限を超えると性能が低下し、外部メモリアクセスが必要となり遅延が増加した。
  • Neural Stickは、512×512解像度でVGG16 などの大規模モデルを処理しようとした際にメモリ制限により失敗し、NC_OUT_OF_MEMORY エラーを返したのに対し、Coralデバイスはより大規模なモデルを安定して処理できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。