[論文レビュー] AccelTran: A Sparsity-Aware Accelerator for Dynamic Inference with Transformers
AccelTranは、ランタイムでの活性化プルーニングを活用するスパarsity対応で動的推論可能なアクセラレータを提案する。これにより無効な演算を低減し、より高いスループットとエネルギー効率を実現する。アーキテクチャはタイル化された行列演算と最適化されたデータフローを採用し、最大1.33倍のスパarsityと、Raspberry Piと比較して93,000倍低いエネルギー消費で330,000倍の高いスループットを達成。Energonを5.73倍スループットで、3.69倍のエネルギー効率で上回る。
Self-attention-based transformer models have achieved tremendous success in the domain of natural language processing. Despite their efficacy, accelerating the transformer is challenging due to its quadratic computational complexity and large activation sizes. Existing transformer accelerators attempt to prune its tokens to reduce memory access, albeit with high compute overheads. Moreover, previous works directly operate on large matrices involved in the attention operation, which limits hardware utilization. In order to address these challenges, this work proposes a novel dynamic inference scheme, DynaTran, which prunes activations at runtime with low overhead, substantially reducing the number of ineffectual operations. This improves the throughput of transformer inference. We further propose tiling the matrices in transformer operations along with diverse dataflows to improve data reuse, thus enabling higher energy efficiency. To effectively implement these methods, we propose AccelTran, a novel accelerator architecture for transformers. Extensive experiments with different models and benchmarks demonstrate that DynaTran achieves higher accuracy than the state-of-the-art top-k hardware-aware pruning strategy while attaining up to 1.2$ imes$ higher sparsity. One of our proposed accelerators, AccelTran-Edge, achieves 330K$ imes$ higher throughput with 93K$ imes$ lower energy requirement when compared to a Raspberry Pi device. On the other hand, AccelTran-Server achieves 5.73$ imes$ higher throughput and 3.69$ imes$ lower energy consumption compared to the state-of-the-art transformer co-processor, Energon. The simulation source code is available at https://github.com/jha-lab/acceltran.
研究の動機と目的
- トランスフォーマー推論における2次関数的複雑性と大きな活性化サイズによる高い計算およびメモリオーバーヘッドに対処すること。
- 低コストのランタイム活性化プルーニングにより、アテンション機構における無効な演算を低減すること。
- 行列タイリングと多様なデータフローを活用したアクセラレータ設計により、ハードウェアの利用効率とエネルギー効率を向上させること。
- エッジおよびサーバーフレームワークの両方で高スループット・低エネルギー推論を実現するため、専用アクセラレータバージョン(AccelTran-Edge および AccelTran-Server)を提供すること。
- 重みのスパarsityにのみ焦点を当てたり、モノリシックな行列処理を採用するなど、従来のアクセラレータの限界(データ再利用性の低さや並列処理の低さ)を克服すること。
提案手法
- 最小限の計算オーバーヘッドでランタイムに活性化をプルーニングする動的推論スキームであるDynaTranを提案し、中間活性化におけるスパarsityを向上させる。
- データ再利用性の向上と処理要素間のハードウェア利用効率の向上を図るため、行列タイリングと複数のデータフロー戦略を採用する。
- ソフトウェアとハードウェアの境界を明確にし、softmax、レイヤーナーミャライゼーション、DynaTran操作の専用RTLモジュールを備えたサイクル正確なアクセラレータアーキテクチャであるAccelTranを設計し、主要演算を1サイクルで実行可能にする。
- トランスフォーマー計算グラフをタイル化され、ハードウェア最適化された演算にマッピングし、動的に最適なデータフローを選択する、新規の制御ブロックを導入する。
- モデルの移動プルーニングと統合し、トランスフォーマーパイプライン内のすべての乗算演算において、重みと活性化の両方のスパarsityを活用する。
- モバイルプラットフォーム向けのAccelTran-Edgeとクラウド規模推論向けのAccelTran-Serverという2つのバージョンを提供し、エッジおよびサーバーデプロイに最適化する。

実験結果
リサーチクエスチョン
- RQ1ランタイムでの活性化プルーニングにより、精度を維持したままトランスフォーマー推論のスループットとエネルギー効率が向上するか?
- RQ2行列タイリングと多様なデータフローを活用することで、トランスフォーマーアクセラレータにおけるデータ再利用性とハードウェア利用効率をどのように向上させられるか?
- RQ3ハードウェアに配慮したトランスフォーマーアクセラレータにおいて、重みと活性化の両方のスパarsityを同時に活用できる範囲はどの程度か?
- RQ4ハードウェアに配慮した動的推論スキームは、静的プルーニングやtop-k戦略と比較して、精度とパフォーマンスの面でどのように差がつくか?
- RQ5同一のアクセラレータアーキテクチャが、異なるパフォーマンスおよびパワー制約を有するエッジおよびサーバーデプロイを効率的にサポートできるか?
主な発見
- DynaTranは、最先端のtop-kハードウェアに配慮したプルーニング戦略と比較して最大1.33倍の高いスパarsityを達成し、精度も優れている。
- AccelTran-Edgeは、Raspberry Piデバイスと比較して330,000倍の高いスループットと93,000倍低いエネルギー消費を達成した。
- AccelTran-Serverは、最先端のEnergonコプロセッサと比較して5.73倍の高いスループットと3.69倍の低いエネルギー消費を達成した。
- 提案されたアクセラレータ設計により、重みだけでなく活性化の両方のスパarsityを活用することで、より高いスループットとエネルギー効率が実現された。
- 行列タイリングと最適化されたデータフローは、ハードウェア利用効率を著しく向上させ、モノリシックな行列処理や行列ベクトル分解アプローチよりも優れたパフォーマンスを実現した。
- 制御ブロックにより動的スケジューリングとデータフロー選択が可能となり、高い並列化を実現した均質なトランスフォーマーレイヤーの効率的実行が可能になった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。