[論文レビュー] Online Algorithms for Hierarchical Inference in Deep Learning applications at the Edge
本稿では、エッジAIにおける階層的推論のためのオンラインメタラーニングフレームワークを提案する。エッジデバイスは、小さな機械学習モデルが出力する最大ソフトマックス値を用いて、局所的推論を受容するか、エッジサーバー上の大きなモデルにオフロードするかを決定する。2つのアルゴリズム—HIL-F(完全フィードバックの場合)とHIL-N(ローカルフィードバックなしの場合)—を導入し、損失関数の滑らかさに関する仮定を必要とせず、それぞれのサブリニアなレグレットバウンドとして $\sqrt{n\ln(1/\lambda_{\text{min}})/2}$ および $O(n^{2/3}\ln^{1/3}(1/\lambda_{\text{min}}))$ を達成する。
We consider a resource-constrained Edge Device (ED), such as an IoT sensor or a microcontroller unit, embedded with a small-size ML model (S-ML) for a generic classification application and an Edge Server (ES) that hosts a large-size ML model (L-ML). Since the inference accuracy of S-ML is lower than that of the L-ML, offloading all the data samples to the ES results in high inference accuracy, but it defeats the purpose of embedding S-ML on the ED and deprives the benefits of reduced latency, bandwidth savings, and energy efficiency of doing local inference. In order to get the best out of both worlds, i.e., the benefits of doing inference on the ED and the benefits of doing inference on ES, we explore the idea of Hierarchical Inference (HI), wherein S-ML inference is only accepted when it is correct, otherwise the data sample is offloaded for L-ML inference. However, the ideal implementation of HI is infeasible as the correctness of the S-ML inference is not known to the ED. We propose an online meta-learning framework that the ED can use to predict the correctness of the S-ML inference. In particular, we propose to use the maximum softmax value output by S-ML for a data sample and decide whether to offload it or not. The resulting online learning problem turns out to be a Prediction with Expert Advice (PEA) problem with continuous expert space. We propose two different algorithms and prove sublinear regret bounds for them without any assumption on the smoothness of the loss function. We evaluate and benchmark the performance of the proposed algorithms for image classification application using four datasets, namely, Imagenette and Imagewoof, MNIST, and CIFAR-10.
研究の動機と目的
- リソース制約のあるエッジデバイス上で、小さなMLモデルの予測の正しさを事前に知らない状態で、リアルタイムの推論意思決定を可能にする。
- 効率性を高めるためにローカルの小さなMLモデルを活用しつつ、正確性を高めるために不確実な予測をエッジサーバー上の大きなモデルにオフロードする階層的推論を可能にする。
- 推論時に真値に依存せず、唯一最大ソフトマックススコアを使用して小さなML推論の正しさを予測するオンライン学習フレームワークを設計する。
- 完全フィードバックおよびローカルフィードバックなしの両状況において、不確実性下での意思決定の理論的レグレットバウンドを確立する。
提案手法
- フレームワークは、小さなMLモデルが出力する最大ソフトマックス確率を信頼度スコアとして用い、局所的推論を受容するか、大きなモデルにオフロードするかを決定する。
- 完全フィードバックの場合(HIL-F)、アルゴリズムは連続的なエキスパート空間を持つ「専門家による予測」問題として扱い、信頼度しきい値の上での指数重み付けを用いる。
- ローカルフィードバックなしの場合(HIL-N)、アルゴリズムは修正された損失関数と疑似損失を用いてレグレット最小化を実行し、意思決定時に真値が入手できない状況に対処する。
- 理論的分析では、オンライン凸最適化と指数重み付けを用い、損失関数の滑らかさに依存しないレグレットバウンドを導出する。
- アルゴリズムは、Imagenette、Imagewoof、MNIST、CIFAR-10のデータセットを用いた画像分類タスクで評価され、性能と頑健性を検証する。
- フレームワークは軽量であり、マイコントローラーやその他のリソース制約のあるエッジデバイスへのデプロイに適している。

実験結果
リサーチクエスチョン
- RQ1エッジデバイスは、真値ラベルにアクセスできない状態でも、自らの小さなMLモデルの推論の正しさを信頼して予測できるか?
- RQ2エネルギー効率および帯域効率を維持しながら、不確実な予測をエッジサーバー上の大きなモデルにオフロードする最適な戦略は何か?
- RQ3損失関数の滑らかさに関する仮定を最小限に抑えて、連続的なエキスパート空間にオンライン学習を適用し、逐次的な意思決定を階層的推論で行うにはどうすればよいか?
- RQ4完全フィードバックおよびローカルフィードバックなしの両設定において、この階層的推論問題で達成可能なレグレットバウンドは何か?
- RQ5提案されたフレームワークは、多様な画像分類ベンチマークにおいて、ベースライン戦略と比較して正確性、遅延、エネルギー効率の観点でどのように差をつけるか?
主な発見
- HIL-Fアルゴリズムは、完全フィードバック設定でレグレットバウンド $\sqrt{n\ln(1/\lambda_{\text{min}})/2}$ を達成し、損失関数の滑らかさに依存しない。
- HIL-Nアルゴリズムは、ローカルフィードバックなし設定でレグレットバウンド $O(n^{2/3}\ln^{1/3}(1/\lambda_{\text{min}}))$ を達成し、真値フィードバックが欠如しても頑健であることを示す。
- レグレットバウンドは損失関数の滑らかさを仮定せず導出されており、実世界のエッジ推論シナリオに広く適用可能である。
- フレームワークは計算オーバーヘッドが低く抑えられており、マイコントローラーなどのリソース制約のあるエッジデバイスへのデプロイに適している。
- 4つのデータセットにおける実験的評価により、不要なオフロードを最小限に抑えることで、正確性、遅延、エネルギー効率のバランスを効果的に実現していることが示された。
- 理論的分析により、大きなモデルが不完全であってもレグレットが有界に保たれることを確認し、オフロードコストおよび信頼度しきい値のばらつきに応じて適切にスケーリングされることを示した。
![Figure 2 : Classification of Imagenette by a small-size quantized MobileNet using width multiplier $0.25$ [ 7 ] .](https://ar5iv.labs.arxiv.org/html/2304.00891/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。