Skip to main content
QUICK REVIEW

[論文レビュー] Offloading Algorithms for Maximizing Inference Accuracy on Edge Device Under a Time Constraint

Andrea Fresa, Jaya Prakash Champati|arXiv (Cornell University)|Dec 21, 2021
IoT and Edge/Fog Computing被引用数 4
ひとこと要約

本稿では、時間制約 T のもとで推論精度を最大化するための近似アルゴリズム AMR² を提案する。エッジデバイス(ED)とエッジサーバー(ES)間での機械学習推論ジョブのオフロードを対象とし、線形計画法(LP)の緩和と丸め処理を用いることで、マケスパン ≤ 2T を保証し、近似的に最適な精度を達成する。実験では、Raspberry Pi に MobileNet および ResNet モデルを搭載した環境で、グリーディベースラインと比較して平均で 40% の精度向上を達成した。

ABSTRACT

With the emergence of edge computing, the problem of offloading jobs between an Edge Device (ED) and an Edge Server (ES) received significant attention in the past. Motivated by the fact that an increasing number of applications are using Machine Learning (ML) inference, we study the problem of offloading inference jobs by considering the following novel aspects: 1) in contrast to a typical computational job, the processing time of an inference job depends on the size of the ML model, and 2) recently proposed Deep Neural Networks (DNNs) for resource-constrained devices provide the choice of scaling the model size. We formulate an assignment problem with the aim of maximizing the total inference accuracy of n data samples available at the ED, subject to a time constraint T on the makespan. We propose an approximation algorithm AMR2, and prove that it results in a makespan at most 2T, and achieves a total accuracy that is lower by a small constant from optimal total accuracy. As proof of concept, we implemented AMR2 on a Raspberry Pi, equipped with MobileNet, and is connected to a server equipped with ResNet, and studied the total accuracy and makespan performance of AMR2 for image classification application.

研究の動機と目的

  • エッジデバイスとエッジサーバー間での ML 推論ジョブのオフロードを扱い、推論精度と実行時間をバランスさせる。
  • エッジコンピューティングにおけるモデルサイズ(処理時間と精度に影響する)と通信オーバーヘッドのトレードオフをモデル化する。
  • マケスパン制約 T のもとで合計推論精度を最大化する新しい一般化割り当て問題を定式化する。
  • 異種かつサイズスケールされた ML モデルを有する ED に対して、マケスパンが有界でかつ近似的に最適な精度を達成する効率的な近似アルゴリズム(AMR²)を設計する。
  • すべてのデータサンプルが同一である場合に最適な動的計画法(AMDP)を提供する。

提案手法

  • 合計推論精度を最大化するための整数線形計画問題(ILP)としてオフロード問題を定式化し、時間制約 T のもとで最適化を実行する。
  • ILP を LP の緩和に変換し、分数解を取得した後、ジョブを ED や ES に割り当てるための丸め手順を実行する。
  • 2段階の丸め戦略を用いる:まず、分数解のジョブを ES に割り当て、その後、マケスパン違反が生じた場合にグリーディ再割り当て手順で再割り当てを行う。
  • AMR² がマケスパンを最大で 2T に保証し、最適解と比較して合計精度損失が最大で 2 であることを証明する。
  • 同一ジョブの場合、最適スケジューリングを計算するための擬似多項式時間の動的計画法(AMDP)を提案する。
  • 実験的に、Raspberry Pi に MobileNet(ED)と ResNet(ES)を搭載した環境で AMR² を評価し、画像分類ワークロードからの実際の処理時間と通信時間を用いた。

実験結果

リサーチクエスチョン

  • RQ1エッジデバイスが複数のモデルサイズ(精度と処理時間が異なる)を備える状況で、厳密な時間制約のもとで推論精度をどのように最大化できるか?
  • RQ2変動するモデルサイズと通信遅延を有する推論ジョブのオフロードに対して、近似アルゴリズムの理論的性能限界は何か?
  • RQ3実世界のエッジデプロイメントにおいて、提案された AMR² アルゴリズムはグリーディベースラインと比較して、精度とマケスパンの点でどのように異なるか?
  • RQ4LP緩和に基づくアプローチは、丸めによるずれが生じるにもかかわらず、なぜ近似的に最適な精度を達成できるのか?
  • RQ5すべてのデータサンプルが同一である場合に、最適解を効率的に計算できるか?その解法の時間計算量は何か?

主な発見

  • AMR² はマケスパンが最大で 2T であることを保証し、緩和された時間制約のもとで実行可能性を確保する。
  • AMR² の合計推論精度は、最適解と比較して最大で 2 の損失に抑えられ、通常の状況では最大モデルと最小モデルの精度差(a_{m+1} - a_1)に制限される。
  • Raspberry Pi 上の実世界実験では、AMR² はグリーディベースライン(Greedy-RRA)と比較して平均で 40% 高い合計推論精度を達成した。
  • T = 0.5 秒の場合、AMR² は Greedy-RRA より 20–60% の精度向上を達成したが、T が小さいとオフロードの機会が限られるため、精度向上は小さくなった。
  • T = 4 秒の場合、AMR² は Greedy-RRA より 40–50% の高い精度を達成し、大きな時間予算下でもスケーラビリティを示した。
  • Raspberry Pi 上で測定したリアルタイムのマケスパンは、アルゴリズムで使用されたタイミングモデルの推定値とよく一致しており、モデルの正確性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。