Skip to main content
QUICK REVIEW

[論文レビュー] Guidelines and Benchmarks for Deployment of Deep Learning Models on Smartphones as Real-Time Apps

Abhishek Sehgal, Nasser Kehtarnavaz|arXiv (Cornell University)|Jan 8, 2019
Advanced Neural Network Applications参考文献 22被引用数 5
ひとこと要約

本稿では、AndroidおよびiOSプラットフォーム上でスマートフォンにリアルタイムアプリケーションとしてディープラーニングモデルをデプロイするための統合フレームワークを提示する。オープンソースツール、マルチスレーディングによるパフォーマンス最適化、および精度、CPU/GPU使用率、スループットを測定するベンチマークスイートを活用しており、6つのCNNモデルを用いて実証されたリアルタイム推論の有効性が確認された。

ABSTRACT

Deep learning solutions are being increasingly used in mobile applications. Although there are many open-source software tools for the development of deep learning solutions, there are no guidelines in one place in a unified manner for using these tools towards real-time deployment of these solutions on smartphones. From the variety of available deep learning tools, the most suited ones are used in this paper to enable real-time deployment of deep learning inference networks on smartphones. A uniform flow of implementation is devised for both Android and iOS smartphones. The advantage of using multi-threading to achieve or improve real-time throughputs is also showcased. A benchmarking framework consisting of accuracy, CPU/GPU consumption and real-time throughput is considered for validation purposes. The developed deployment approach allows deep learning models to be turned into real-time smartphone apps with ease based on publicly available deep learning and smartphone software tools. This approach is applied to six popular or representative convolutional neural network models and the validation results based on the benchmarking metrics are reported.

研究の動機と目的

  • スマートフォン上でディープラーニングモデルをリアルタイムモバイルアプリケーションとしてデプロイするための統合的で実用的なガイドラインの欠如に対処すること。
  • 事前学習済みディープラーニング推論ネットワークを、AndroidおよびiOSの両プラットフォームで標準化されたクロスプラットフォームワークフローでデプロイすること。
  • 精度、計算リソース消費(CPU/GPU)、リアルタイムスループットメトリクスを用いて、モデルパフォーマンスを評価およびベンチマークすること。
  • マルチスレーディングがリアルタイム動作における推論スループットを向上させるのにどのように有効に活用できるかを示すこと。
  • 6つの代表的な畳み込みニューラルネットワークモデルを対象として、フレームワークの有効性を検証すること。

提案手法

  • AndroidおよびiOSの両方のプラットフォーム向けに、公開済みのディープラーニングおよびモバイル開発ツールを用いて、一貫したソフトウェアデプロイメントパイプラインを設計した。
  • モデル推論と入力処理を並列化することで、リアルタイム推論スループットを向上させるためにマルチスレーディングを実装した。
  • モデルの精度、CPU/GPU使用率、リアルタイム推論スループット(フレーム/秒)という3つのコアメトリクスを有するベンチマークフレームワークを構築した。
  • スマートフォンプラットフォームと互換性のあるデバイス内推論エンジンを用いて、事前学習済みの畳み込みニューラルネットワークモデルを変換・デプロイした。
  • モデルの量子化と最適化技術を統合することで、顕著な精度損失なしに計算負荷を低減した。
  • 実際のスマートフォンを用いてパフォーマンスを評価し、通常のモバイルワークロード下での実用的リアルタイム動作を保証した。

実験結果

リサーチクエスチョン

  • RQ1AndroidおよびiOSスマートフォンの両方で、ディープラーニングモデルをリアルタイムアプリケーションとしてデプロイするための統合的で実用的なワークフローは何か?
  • RQ2マルチスレーディングは、モバイルデバイス上でリアルタイム推論スループットをどのように効果的に向上させることができるか?
  • RQ3スマートフォン上でディープラーニングモデルをデプロイする際の、モデルの精度、CPU/GPU使用率、推論速度の間のトレードオフは何か?
  • RQ4代表的なセットに属するどのディープラーニングモデルが、一般消費者向けスマートフォンでリアルタイムパフォーマンスを達成できるか?
  • RQ5異なる最適化戦略は、デバイス内推論の効率性とレイテンシにどのように影響を与えるか?

主な発見

  • 提案されたデプロイメントフレームワークは、消費者向けスマートフォン上で6つの多様なCNNモデルのリアルタイム推論を成功裏に実現し、デバイス間で一貫したスループットを達成した。
  • マルチスレーディングはリアルタイムパフォーマンスを顕著に向上させ、入力処理および推論パイプラインにおけるフレーム/秒の増加が明確に測定された。
  • ベンチマークフレームワークは、モデルの精度と計算効率のトレードオフを効果的に捉えており、モバイルデプロイメントに適したモデル選定を支援する。
  • CPUおよびGPU使用率のメトリクスから、最適化されたモデルがリアルタイム制約(例:30 FPS)を満たしながらも低リソース消費を維持していることが示された。
  • このアプローチは再現可能で再利用可能であり、公開済みのツールに依存するため、研究者や開発者にとって容易にアクセス可能である。
  • 本研究では、標準的なオープンソースツールチェーンを用いることで、スマートフォン上でのディープラーニングモデルのリアルタイムデプロイが実現可能で実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。