Skip to main content
QUICK REVIEW

[論文レビュー] Characterizing the Deep Neural Networks Inference Performance of Mobile Applications

Samuel S. Ogden, Tian Guo|arXiv (Cornell University)|Sep 10, 2019
Advanced Neural Network Applications参考文献 44被引用数 20
ひとこと要約

本論文では、変動するネットワーク状態下でのエンドツーエンド遅延と精度のバランスを取るために、実行時における事前学習済みCNNモデルの選択によって、モバイルアプリケーションにおけるクラウドベースのディープニューラルネットワーク推論を最適化する動的モデル選択アルゴリズムであるCNNSelectを提案する。グリーディ選択と比較してSLA準拠率を88.5%向上させつつ、特に厳しい遅延予算下でも同等の精度を維持する。

ABSTRACT

Today's mobile applications are increasingly leveraging deep neural networks to provide novel features, such as image and speech recognitions. To use a pre-trained deep neural network, mobile developers can either host it in a cloud server, referred to as cloud-based inference, or ship it with their mobile application, referred to as on-device inference. In this work, we investigate the inference performance of these two common approaches on both mobile devices and public clouds, using popular convolutional neural networks. Our measurement study suggests the need for both on-device and cloud-based inferences for supporting mobile applications. In particular, newer mobile devices is able to run mobile-optimized CNN models in reasonable time. However, for older mobile devices or to use more complex CNN models, mobile applications should opt in for cloud-based inference. We further demonstrate that variable network conditions can lead to poor cloud-based inference end-to-end time. To support efficient cloud-based inference, we propose a CNN model selection algorithm called CNNSelect that dynamically selects the most appropriate CNN model for each inference request, and adapts its selection to match different SLAs and execution time budgets that are caused by variable mobile environments. The key idea of CNNSelect is to make inference speed and accuracy trade-offs at runtime using a set of CNN models. We demonstrated that CNNSelect smoothly improves inference accuracy while maintaining SLA attainment in 88.5% more cases than a greedy baseline.

研究の動機と目的

  • モバイルアプリケーションにおけるオンデバイス型とクラウドベースのディープニューラルネットワーク推論の性能トレードオフを特定すること。
  • モバイルハードウェア、ネットワーク状態、モデル圧縮技術を含む、推論に影響を与える主要な性能要因を同定すること。
  • クラウドベース推論における変動するネットワーク状態がエンドツーエンド遅延とSLA準拠性を低下させるという課題に対処すること。
  • 動的モバイル環境に適応する実行時モデル選択アルゴリズムを設計し、推論精度と遅延の両立を図ること。
  • 提案されたCNNSelectアルゴリズムのSLA達成率および性能効率向上の有効性を評価すること。

提案手法

  • 著者らは、複数のモバイルデバイスとクラウドサーバーを対象に実地測定調査を実施し、さまざまなCNNモデルとフレームワーク(Caffe、TensorFlow)におけるエンドツーエンド推論時間およびリソース消費量を評価した。
  • モバイルハードウェア、ディープラーニングフレームワーク、モデル圧縮、ネットワーク状態がオンデバイスおよびクラウドベース推論性能に与える影響を分析した。
  • CNNSelectは、リアルタイムのネットワーク転送時間とSLA制約に基づいて、最も適切なCNNモデルを選択する確率的モデル選択戦略を採用している。
  • アルゴリズムは、精度と推論速度のトレードオフが異なる事前学習済みでモバイル最適化されたCNNモデルの集合を維持している。
  • 変化するネットワーク状態に適応し、エンドツーエンド遅延を最小限に抑えつつ、精度とSLA要件を満たすために実行時にモデルを動的に選択する。
  • エンドツーエンドテストと広範なシミュレーションを用いて、多様なモバイル環境下でのCNNSelectの性能を検証した。

実験結果

リサーチクエスチョン

  • RQ1オンデバイス型およびクラウドベースのDNN推論に影響を与える主な性能要因は何か?
  • RQ2モバイルハードウェア、ネットワーク状態、モデル圧縮技術が推論遅延と精度に与える影響はどの程度か?
  • RQ3変動するネットワーク状態がクラウドベース推論性能とSLA準拠性に及ぼす影響はどの程度か?
  • RQ4動的モデル選択戦略は、変動するモバイル環境下でも高い推論精度を維持しつつSLA準拠率を向上させることができるか?
  • RQ5CNNSelectは、グリーディモデル選択と比較して、SLA達成率および遅延低減の点でどの程度優れているか?

主な発見

  • 最新のモバイルデバイスでは、モバイル最適化CNNモデルを搭載することでオンデバイス推論が実現可能であるが、旧式デバイスや複雑なモデルではクラウドベース推論が必要となる。
  • クラウド推論におけるモデル起動遅延は、オーダー・オブ・マグニチュードのオーバーヘッドを引き起こすため、サーバー展開において注意深く管理する必要がある。
  • 変動するモバイルネットワーク状態は、特に高い変動性が見られる状況下で、エンドツーエンドクラウド推論遅延を顕著に悪化させる。
  • CNNSelectは、グリーディベースラインと比較してSLA達成率を88.5%向上させた。特に厳しい遅延予算下で顕著な改善が得られた。
  • SLA予算が250msを超える場合、CNNSelectは最大43%のエンドツーエンド遅延低減を達成しながら、同等の精度を維持した。
  • アルゴリズムは、リアルタイムのネットワーク状態とSLA要件に応じてモデル選択を適応させることで、精度と遅延の両立を効果的に実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。