Skip to main content
QUICK REVIEW

[論文レビュー] Accelerating Framework of Transformer by Hardware Design and Model Compression Co-Optimization

Panjie Qi, Edwin H.‐M. Sha|arXiv (Cornell University)|Oct 19, 2021
Advanced Data Compression Techniques被引用数 4
ひとこと要約

本論文は、階層的プルーニング(HP)によるモデル圧縮とFPGA固有のハードウェアアクセラレーションを共同で最適化することで、Transformer推論を統合的に高速化するハードウェア・ソフトウェアフレームワークを提案する。このフレームワークは、遅延と精度の制約に基づき、最適なデバイスを自動的に選択し、CPUに対して最大37倍、GPUに対して1.9倍の高速化を達成する。また、最大98%の高いスパarsity率と、カスタムスパース行列ストレージによる効率的なメモリ使用を実現する。

ABSTRACT

State-of-the-art Transformer-based models, with gigantic parameters, are difficult to be accommodated on resource constrained embedded devices. Moreover, with the development of technology, more and more embedded devices are available to run a Transformer model. For a Transformer model with different constraints (tight or loose), it can be deployed onto devices with different computing power. However, in previous work, designers did not choose the best device among multiple devices. Instead, they just used an existing device to deploy model, which was not necessarily the best fit and may lead to underutilization of resources. To address the deployment challenge of Transformer and the problem to select the best device, we propose an algorithm & hardware closed-loop acceleration framework. Given a dataset, a model, latency constraint LC and accuracy constraint AC, our framework can provide a best device satisfying both constraints. In order to generate a compressed model with high sparsity ratio, we propose a novel pruning technique, hierarchical pruning (HP). We optimize the sparse matrix storage format for HP matrix to further reduce memory usage for FPGA implementation. We design a accelerator that takes advantage of HP to solve the problem of concurrent random access. Experiments on Transformer and TinyBert model show that our framework can find different devices for various LC and AC, covering from low-end devices to high-end devices. Our HP can achieve higher sparsity ratio and is more flexible than other sparsity pattern. Our framework can achieve 37x, 1.9x, 1.7x speedup compared to CPU, GPU and FPGA, respectively.

研究の動機と目的

  • リソース制限のある埋め込みデバイスに大規模なTransformerモデルを、異なる性能要件を満たすように展開する課題に対処すること。
  • モデル圧縮とハードウェア選定を共同最適化しない従来の逐次的設計フローの非効率性を克服すること。
  • ユーザーが指定した遅延と精度の制約に基づき、FPGAやモバイルデバイスを含む多様なハードウェアプラットフォームから自動で最適なデバイスを選択可能にする仕組みを提供すること。
  • 効率的なスパース行列ストレージとハードウェアマッピングを可能にする、柔軟なブロックレベルのスパarsityパターンを備えた、高スパarsityの柔軟なプルーニング手法(階層的プルーニング)を開発すること。
  • HPのスパarsityパターンを活用してメモリアクセスのオーバーヘッドを低減し、スループットを向上させるハードウェアアクセラレータを設計すること。

提案手法

  • ユーザー定義の遅延(LC)および精度(AC)制約の下で、モデルスパarsityとハードウェアデプロイメントを共同最適化するアルゴリズム ⇄ ハードウェアクローズドループフレームワークを提案する。
  • 異なるレイヤーで柔軟なブロックレベルのスパarsityパターンを実現できる、高スパarsity(最大98%)を達成可能な新規構造的プルーニング技術「階層的プルーニング(HP)」を導入する。
  • HPのスパarsityパターンに最適化されたカスタムスパース行列ストレージフォーマットを設計し、FPGA上でのメモリフットプリントを最小限に抑える。
  • スパース重みへの同時ランダムアクセスをサポートする専用FPGAアクセラレータを開発し、メモリ帯域幅の利用効率を向上させる。
  • LCおよびAC制約をガイドとして、スパarsity比とデバイス構成の探索空間を強化学習(RL)で探索する。
  • CPU、GPU、FPGAプラットフォーム間での性能評価・比較のため、FLOPSおよびリソース利用率を指標として用いる。

実験結果

リサーチクエスチョン

  • RQ1特定の遅延および精度の制約下で、Transformerモデルを展開する際の最適なハードウェアプラットフォームは何か?
  • RQ2モデル圧縮とハードウェアアクセラレーションを共同で最適化することで、推論速度とリソース利用効率を最大限に高めることは可能か?
  • RQ3階層的プルーニング戦略は、従来の構造的プルーニング手法と比較して、より高いスパarsity比を達成しながらモデル精度を保持できるか?
  • RQ4提案されたスパースストレージフォーマットは、FPGA上でどのようにしてメモリ使用量を削減し、パフォーマンスを向上させるか?
  • RQ5フレームワークは、ZCU102やAlveo U200などの多様なプラットフォームの集合から、異なる制約セットに対して最適なデバイスを自動で選択できるか?

主な発見

  • フレームワークは、低性能FPGA(ZCU102)から高機能デバイス(Alveo U200)まで、さまざまなLCおよびAC制約の下で最適なデバイスを正確に同定し、多様な埋め込みプラットフォームへの展開を可能にする。
  • 階層的プルーニングは最大98%のスパarsity比を達成し、VWなどの従来手法が90%で上限となるのと比較して顕著に高いスパarsityを実現。また、高スパarsityレベルでも精度の保持が優れている。
  • FPGAアクセラレータはCPUに対して37倍、GPUに対して1.9倍、かつ以前のFPGA実装(FTRANS)に対して1.7倍の高速化を達成し、優れた効率性を示す。
  • 同じ制約(例:50ms、80%精度)の下で、フレームワークはモデル圧縮により低性能FPGA(ZCU102)にマッピング可能であり、異なるアプリケーションシナリオでの再利用を可能にする。
  • RLガイドド探索は、ターゲット制約(26ms、96%)の周辺に解を集中させ、リソース利用率をタイブレーカーとして用いることで、最もコスト効果の高いデバイスを選択する。
  • スパarsityが88%のとき、40%のバックボーンモデルが96.4%の精度を達成し、60%および70%のバックボーンスパarsityを持つモデルを上回る性能を示しており、高圧縮下でも初期スパarsityが低いほど精度がよりよく保持されることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。