Skip to main content
QUICK REVIEW

[論文レビュー] Energon: Towards Efficient Acceleration of Transformers Using Dynamic Sparse Attention

Zhe Zhou, Junlin Liu|arXiv (Cornell University)|Oct 18, 2021
Advanced Neural Network Applications被引用数 7
ひとこと要約

Energonは、ミックス・プレシジョン・マルチラウンドフィルタリング(MP-MRF)アルゴリズムを用いてランタイムで重要とされるクエリ-キー対を特定し、高精度計算を特定のペアに限定することで、動的スパースアテンションを介してTransformerの高速化を実現する共同設計フレームワークを提案する。この手法は、NLPおよびCVワークロードにおいてCPUおよびGPUベースラインと比較して最大168倍の高速化と10⁴倍のエネルギー削減を達成する。

ABSTRACT

In recent years, transformer models have revolutionized Natural Language Processing (NLP) and shown promising performance on Computer Vision (CV) tasks. Despite their effectiveness, transformers' attention operations are hard to accelerate due to the complicated data movement and quadratic computational complexity, prohibiting the real-time inference on resource-constrained edge-computing platforms. To tackle this challenge, we propose Energon, an algorithm-architecture co-design approach that accelerates various transformers using dynamic sparse attention. With the observation that attention results only depend on a few important query-key pairs, we propose a Mix-Precision Multi-Round Filtering (MP-MRF) algorithm to dynamically identify such pairs at runtime. We adopt low bitwidth in each filtering round and only use high-precision tensors in the attention stage to reduce overall complexity. By this means, we significantly mitigate the computational cost with negligible accuracy loss. To enable such an algorithm with lower latency and better energy efficiency, we also propose an Energon co-processor architecture. Elaborated pipelines and specialized optimizations jointly boost the performance and reduce power consumption. Extensive experiments on both NLP and CV benchmarks demonstrate that Energon achieves $168 imes$ and $8.7 imes$ geo-mean speedup and up to $10^4 imes$ and $10^3 imes$ energy reduction compared with Intel Xeon 5220 CPU and NVIDIA V100 GPU. Compared to state-of-the-art attention accelerators SpAtten and $A^3$, Energon also achieves $1.7 imes, 1.25 imes$ speedup and $1.6 imes, 1.5 imes $ higher energy efficiency.

研究の動機と目的

  • リソース制限のあるエッジプラットフォームにおいて、特に高い計算およびメモリオーバーヘッドを示すTransformerの自己アテンション処理を軽減すること。
  • SpAtten や A³ といった先行研究のスパースアテンション手法が直面する固定のプリーニング戦略、高いオフチップメモリアクセス、モデルの再トレーニングを要するといった制限を克服すること。
  • 高い精度を維持しつつ、複雑性を著しく低減する、効率的で動的かつハードウェアに配慮したアテンション計算を実現すること。
  • MP-MRFアルゴリズムを効率的に加速するための最適化されたパイプラインとメモリアクセスパターンを備えた共同プロセッサアーキテクチャの設計。
  • クラウドおよびエッジ環境における実世界のデプロイシナリオを含め、多様なNLPおよびCVベンチマークにおいて、本手法の有効性を実証すること。

提案手法

  • ランタイムで重要とされるクエリ-キー対を低ビット幅の演算を用いて特定するためのミックス・プレシジョン・マルチラウンドフィルタリング(MP-MRF)アルゴリズムを提案する。
  • 複数ラウンドにわたり低精度(例:4ビット)のフィルタリングを実行し、事前に重要なアテンションペアの候補空間を段階的に絞り込むことで、高精度アテンション計算の前処理としてのスループットを向上させる。
  • 最終的なアテンション計算には、フィルタリング済みのペアにのみ高精度(例:16ビット)テンソルを適用し、全体の計算コストを最小限に抑える。
  • MP-MRFおよびスパースアテンション実行を高速化するための専用パイプラインとメモリ最適化を備えたEnergon共同プロセッサを設計する。
  • さまざまなワークロードおよびコア数を想定した下でボトルネックを分析し、ハードウェア構成をガイドするためのパフォーマンスモデルを実装する。
  • エッジおよびサーバープラットフォーム(Energon-edge および Energon-server)にEnergonアクセラレータを統合し、エンドツーエンドのパフォーマンスとスケーラビリティを評価する。

実験結果

リサーチクエスチョン

  • RQ1動的でランタイムに特定されたスパースアテンションは、顕著な精度損失を伴わず、Transformerにおける計算複雑性を低減できるか?
  • RQ2ミックス・プレシジョン・マルチラウンドフィルタリング戦略は、最小限の精度損失で、重要なクエリ-キー対を効果的に同定できるか?
  • RQ3Energon共同プロセッサアーキテクチャは、スパースアテンションワークロードのメモリアクセスとパイプライン効率をどのように最適化しているか?
  • RQ4多様なNLPおよびCVタスクにおいて、SpAtten や A³ といった最先端アクセラレータと比較して、Energonはどれほど高速かつエネルギー効率に優れているか?
  • RQ5コア数を増加させた場合、Energonのスケーラビリティはどの程度で、パフォーマンスボトルネックはどこに存在するか?

主な発見

  • クラウドワークロードにおいて、Intel Xeon 5220 CPUと比較して、Energonは幾何平均で168倍の高速化と10⁴倍のエネルギー削減を達成した。エッジプラットフォームでは、ARM-A72 CPUと比較して440倍の高速化と2951倍のエネルギー削減を達成した。
  • NLPベンチマークでは、NVIDIA V100 GPUと比較して、Energonは最大8.7倍の高速化と10³倍のエネルギー削減を達成し、性能とエネルギー効率の両面でSpAtten や A³ を上回った。
  • MP-MRFアルゴリズムにより、計算量が4倍から8倍まで削減され、精度損失は無視できるほど小さく、モデルの再トレーニングなしに動的プリーニングが可能となった。
  • Energon搭載システムでは、オフロード化されパイプライン化されたアテンション実行のおかげで、エンドツーエンドのレイテンシが1.21倍低減し、スループットが1.55倍向上した。
  • スケーラビリティ分析の結果、コア数を4から16に増加させることでエンドツーエンドのレイテンシが顕著に低下したが、16コアを超えるとメモリ帯域幅の制限により性能向上が頭打ちとなった。
  • SpAttenと比較して、EnergonはタスクA、C、Dでそれぞれ16倍、8倍、8倍のプリーニングを達成したのに対し、SpAttenは再トレーニングなしでたった2倍のプリーニングにとどまり、優れたスパarsityと精度のトレードオフを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。