Skip to main content
QUICK REVIEW

[論文レビュー] Mitigating Edge Machine Learning Inference Bottlenecks: An Empirical Study on Accelerating Google Edge Models

Amirali Boroumand, Saugata Ghose|arXiv (Cornell University)|Mar 1, 2021
Privacy-Preserving Technologies in Data参考文献 29被引用数 20
ひとこと要約

この論文では、多様なGoogleエッジモデル(CNN、LSTM、トランスデューサ、RCNN)のレイヤーを、レイヤーの特徴に基づいて、専用のオンチップおよびニアデータアクセラレータに動的にスケジューリングする、異種ML推論加速フレームワークMensaを提案する。レイヤーを3つの異なるタイプにクラスタリングすることで、MensaはGoogle Edge TPUに対して3.0倍のエネルギー効率の向上と3.1倍のスループット向上を達成し、24の実世界のエッジモデルにおいてEyeriss v2よりも2.4倍/4.3倍の向上を示した。

ABSTRACT

As the need for edge computing grows, many modern consumer devices now contain edge machine learning (ML) accelerators that can compute a wide range of neural network (NN) models while still fitting within tight resource constraints. We analyze a commercial Edge TPU using 24 Google edge NN models (including CNNs, LSTMs, transducers, and RCNNs), and find that the accelerator suffers from three shortcomings, in terms of computational throughput, energy efficiency, and memory access handling. We comprehensively study the characteristics of each NN layer in all of the Google edge models, and find that these shortcomings arise from the one-size-fits-all approach of the accelerator, as there is a high amount of heterogeneity in key layer characteristics both across different models and across different layers in the same model. We propose a new acceleration framework called Mensa. Mensa incorporates multiple heterogeneous ML edge accelerators (including both on-chip and near-data accelerators), each of which caters to the characteristics of a particular subset of models. At runtime, Mensa schedules each layer to run on the best-suited accelerator, accounting for both efficiency and inter-layer dependencies. As we analyze the Google edge NN models, we discover that all of the layers naturally group into a small number of clusters, which allows us to design an efficient implementation of Mensa for these models with only three specialized accelerators. Averaged across all 24 Google edge models, Mensa improves energy efficiency and throughput by 3.0x and 3.1x over the Edge TPU, and by 2.4x and 4.3x over Eyeriss v2, a state-of-the-art accelerator.

研究の動機と目的

  • 多様な最先端のエッジニューラルネットワークモデルを実行する際の商業的Google Edge TPUにおける性能ボトルネックを特定および分析すること。
  • CNN、LSTM、トランスデューサ、RCNNにおける、FLOP/バイト比、フットプリント、データ再利用などのレイヤー特性における、モデル内およびモデル間の高い異種性を定量化すること。
  • 特定のアクセラレータをレイヤークラスタの計算およびメモリアクセスパターンに基づいてマッチングする、異種アクセラレータフレームワークMensaを設計すること。
  • Mensaの最小限の3アクセラレータ設計が、多様なエッジワークロードにおいてモノリシックおよび再構成可能アクセラレータを上回ることを実証すること。
  • 24の実世界のGoogleエッジモデルを用いた包括的な評価を通じて、フレームワークの有効性を検証し、エネルギー効率およびスループットにおいて顕著な向上を示すこと。

提案手法

  • FLOP/バイト比、パラメータフットプリント、データ再利用パターンなどの主要メトリクスを特徴付けるために、24のGoogleエッジモデルの各レイヤーを分析する。
  • 共通の特徴を持つレイヤーを3つの異なるグループにクラスタリングし、アクセラレータのターゲティング特化を可能にする。
  • 3つの異種アクセラレータを設計する:Pascal(高計算量・高再利用レイヤー向け)、Pavlov(低再利用の再帰的レイヤー向け)、Jacquard(低フットプリント・高帯域幅レイヤー向け)。
  • レイヤー間の依存関係を尊重し、利用度を最大化するように、各レイヤーを最適なアクセラレータに割り当てるランタイムスケジューラを実装する。
  • メモリボトルネックを軽減し帯域幅効率を向上させるために、オンチップおよびニアデータ処理ユニット(例:メモリ内処理)を統合する。
  • 実ワークロードを用いて、Throughput、エネルギー効率、推論遅延を測定することで、MensaをEdge TPUおよびEyeriss v2と比較して評価する。

実験結果

リサーチクエスチョン

  • RQ1多様なエッジニューラルネットワークモデルを実行する際のGoogle Edge TPUにおける主な性能ボトルネックは何か?
  • RQ2FLOP/バイト比、フットプリント、データ再利用などのレイヤー特性における、モデル内およびモデル間の異種性は、アクセラレータ効率にどの程度影響を与えるか?
  • RQ3共通の特徴に基づくレイヤークラスタリングは、エッジML推論のための異種アクセラレータの有効な特化を可能にするか?
  • RQ4モノリシックまたは再構成可能設計と比較して、目的のアクセラレータにレイヤーを動的にスケジューリングすることで、どの程度の性能向上が達成できるか?
  • RQ5多様なエッジモデルにわたる高いパフォーマンスを達成するための最適な専用アクセラレータの数および種別は何か?

主な発見

  • Google Edge TPUは24のエッジモデル全体で平均25%のスループット利用率にとどまり、LSTMおよびトランスデューザは、データフローやメモリアクセスパターンの不一致により1%未満の利用率を示した。
  • Edge TPUは平均して理論ピークエネルギー効率の37%しか活用していない。主にオンチップバッファの未利用と非効率なメモリアクセス処理が原因である。
  • 1つのモデル内でレイヤー特性は最大2桁の違いを示し、特に分離可能畳み込みと再帰的ユニットを用いたエッジ最適化モデルで顕著である。
  • Mensaは24のすべてのモデルにおいて、Edge TPUに対してエネルギー効率を3.0倍、スループットを3.1倍向上させた。Eyeriss v2と比較すると、それぞれ2.4倍および4.3倍の向上を達成した。
  • LSTMおよびトランスデューザでは、Pavlovの最適化されたデータフローとメモリ内処理のサポートにより、Mensaで5.4倍の遅延低減が達成された。一方、CNNはマルチアクセラレータ負荷分散の恩恵を受けていた。
  • 3アクセラレータのMensa設計は、最小限のランタイムオーバーヘッドですべてのモデルタイプを効果的に処理でき、少数の専用ユニットが一般用途または再構成可能設計を上回ることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。