Skip to main content
QUICK REVIEW

[論文レビュー] EdgeBERT: Sentence-Level Energy Optimizations for Latency-Aware Multi-Task NLP Inference

Thierry Tambe, Coleman Hooper|arXiv (Cornell University)|Nov 28, 2020
Topic Modeling参考文献 81被引用数 9
ひとこと要約

EdgeBERT は、エッジデバイスにおける遅延に配慮した低消費電力なマルチタスク NLP 推論のためのハードウェア・アルゴリズム共同設計を提案する。文単位の早期終了とエントロピーに基づく予測を用い、動的電圧周波数スケーリング(DVFS)を可能にするとともに、適応的アテンションスパン、プルーニング、量子化、および eNVM に格納された共有埋め込みを組み合わせ、GPU 推論に比べ最大 53×、従来の BERT 推論に比べ最大 7× の消費電力削減を達成しながら、厳密な遅延制約を満たす。

ABSTRACT

Transformer-based language models such as BERT provide significant accuracy improvement for a multitude of natural language processing (NLP) tasks. However, their hefty computational and memory demands make them challenging to deploy to resource-constrained edge platforms with strict latency requirements. We present EdgeBERT, an in-depth algorithm-hardware co-design for latency-aware energy optimization for multi-task NLP. EdgeBERT employs entropy-based early exit predication in order to perform dynamic voltage-frequency scaling (DVFS), at a sentence granularity, for minimal energy consumption while adhering to a prescribed target latency. Computation and memory footprint overheads are further alleviated by employing a calibrated combination of adaptive attention span, selective network pruning, and floating-point quantization. Furthermore, in order to maximize the synergistic benefits of these algorithms in always-on and intermediate edge computing settings, we specialize a 12nm scalable hardware accelerator system, integrating a fast-switching low-dropout voltage regulator (LDO), an all-digital phase-locked loop (ADPLL), as well as, high-density embedded non-volatile memories (eNVMs) wherein the sparse floating-point bit encodings of the shared multi-task parameters are carefully stored. Altogether, latency-aware multi-task NLP inference acceleration on the EdgeBERT hardware system generates up to 7x, 2.5x, and 53x lower energy compared to the conventional inference without early stopping, the latency-unbounded early exit approach, and CUDA adaptations on an Nvidia Jetson Tegra X2 mobile GPU, respectively.

研究の動機と目的

  • リソース制約のあるエッジプラットフォームに BERT をデプロイする際の高い消費電力と遅延コストを低減すること。
  • リアルタイムアプリケーションにおける従来の早期終了メカニズムが引き起こす遅延のばらつきを克服すること。
  • アルゴリズムとハードウェアの共同設計により、エッジ NLP 推論における消費電力を最小限に抑えること。
  • 適応的アテンションスパン、プルーニング、および 8 ビット量子化を用いて、メモリおよび計算のオーバーヘッドを低減すること。
  • 常にオンのエッジデバイスにおける恒久的で低消費電力の動作を実現するため、共有埋め込みを高密度 eNVM に格納すること。

提案手法

  • 推論を早期に終了できるかどうかを予測するため、文単位のエントロピーに基づく早期終了を採用し、計算量と消費電力を削減する。
  • 高速スイッチング LDO とオールデジタル PLL を用いて、供給電圧とクロック周波数をリアルタイムで調整する動的電圧周波数スケーリング(DVFS)を統合する。
  • 微調整中に適応的アテンションスパンを適用し、スパarsなアテンションパターンを学習することで、不要な行列演算を最小限に抑える。
  • 選択的ネットワークプルーニングと 8 ビット浮動小数点量子化を用いて、モデルサイズとメモリ帯域幅を削減する。
  • ビットマスクエンコーディングを用いて、高密度埋め込み非揮発性メモリ(eNVM)に共有マルチタスク語の埋め込みを格納し、エネルギー効率の良いアクセスを実現する。
  • 主要演算(ソフトマックス、レイヤーノーマライゼーション、アテンションマスク)の数値安定性とエネルギー効率を最適化するように、EdgeBERT アクcelerator を共同設計する。

実験結果

リサーチクエスチョン

  • RQ1エントロピーに基づく信頼度予測を用いた早期終了は、エッジデバイスにおけるエネルギー最適化かつ遅延制約を満たす推論を可能にするか?
  • RQ2文単位の推論と効果的に統合できる動的電圧周波数スケーリング(DVFS)は、遅延制約を満たしつつ消費電力を最小限に抑えるためにどのように実装できるか?
  • RQ3適応的アテンションスパンとモデル圧縮技術を用いることで、BERT 推論におけるメモリおよび計算のオーバーヘッドをどの程度低減できるか?
  • RQ4SRAM ではなく eNVM に共有埋め込みを格納することで、システムレベルでの消費電力とパフォーマンスにどのような利点が得られるか?
  • RQ5アルゴリズム最適化と専用ハードウェアの共同設計は、従来の GPU ベースやフルモデル推論と比較して、エネルギーと遅延の点でどの程度優れているか?

主な発見

  • EdgeBERT は、エッジハードウェア上で従来のフルモデル BERT 推論に比べ最大 7× の低い消費電力で動作する。
  • 遅延に制限のない早期終了アプローチ(遅延保証なし)に比べ、消費電力を 2.5× 削減する。
  • Nvidia Jetson Tegra X2 モバイル GPU 上の CUDA 実装に比べ、システム全体で 53× の消費電力削減を達成する。
  • eNVM を用いた共有語の埋め込み格納により、システム起動時およびアイドル時における消費電力を低減する。
  • 適応的アテンションスパンとスパース計算の組み合わせにより、不要な DRAM アクセスが排除され、エネルギー効率が向上する。
  • 高速スイッチング LDO と ADPLL を用いることで、リアルタイムでの DVFS 調整が可能となり、ターゲット遅延要件を満たす最小限の電圧と周波数を確保できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。