Skip to main content
QUICK REVIEW

[論文レビュー] HAT: Hardware-Aware Transformers for Efficient Natural Language Processing

Hanrui Wang, Zhanghao Wu|arXiv (Cornell University)|May 28, 2020
Advanced Neural Network Applications参考文献 70被引用数 21
ひとこと要約

HATは、特定のハードウェアプラットフォームに最適化された効率的なTransformerモデルを発見するためのハードウェアに配慮したニューラルアーキテクチャサーチフレームワークを提案する。重み共有のスーパートランスフォーマーを訓練し、実際のハードウェア遅延フィードバックを用いた進化的探索を実施することで、Raspberry Pi-4上でTransformer-Bigに比べて最大3倍の推論速度向上と3.7倍のモデルサイズ削減を達成した。また、先行研究に比べ12,041倍の低い探索コストを実現し、精度の損失なしに実現した。

ABSTRACT

Transformers are ubiquitous in Natural Language Processing (NLP) tasks, but they are difficult to be deployed on hardware due to the intensive computation. To enable low-latency inference on resource-constrained hardware platforms, we propose to design Hardware-Aware Transformers (HAT) with neural architecture search. We first construct a large design space with $ extit{arbitrary encoder-decoder attention}$ and $ extit{heterogeneous layers}$. Then we train a $ extit{SuperTransformer}$ that covers all candidates in the design space, and efficiently produces many $ extit{SubTransformers}$ with weight sharing. Finally, we perform an evolutionary search with a hardware latency constraint to find a specialized $ extit{SubTransformer}$ dedicated to run fast on the target hardware. Extensive experiments on four machine translation tasks demonstrate that HAT can discover efficient models for different hardware (CPU, GPU, IoT device). When running WMT'14 translation task on Raspberry Pi-4, HAT can achieve $ extbf{3} imes$ speedup, $ extbf{3.7} imes$ smaller size over baseline Transformer; $ extbf{2.7} imes$ speedup, $ extbf{3.6} imes$ smaller size over Evolved Transformer with $ extbf{12,041} imes$ less search cost and no performance loss. HAT code is https://github.com/mit-han-lab/hardware-aware-transformers.git

研究の動機と目的

  • CPU、GPU、IoTデバイスなどのリソース制限のあるハードウェアプラットフォームに計算集約的であるトランスフォーマーをデプロイする課題に対処すること。
  • 異なるプラットフォーム間での実際のハードウェアパフォーマンスの違いを反映しないFLOPsを遅延の代理指標として使用する限界を克服すること。
  • 特にハードウェア特化型モデル向けに、従来のニューラルアーキテクチャサーチ手法が示す非常に高い探索コストを低減すること。
  • モデルパフォーマンスを損なわせることなく、効率的で正確かつハードウェア特化型のトランスフォーマーを実現すること。

提案手法

  • 任意のエンコーダデコーダアテンションと異種のトランスフォーマーレイヤーを含む広大な探索空間を構築し、アーキテクチャの多様性を可能にする。
  • すべてのサブネットワーク(サブトランスフォーマー)間で重みを共有するスーパートランスフォーマーを訓練することで、すべての候補アーキテクチャを効率的に同時に学習可能にする。
  • 各ターゲットハードウェアプラットフォーム向けに最適なサブトランスフォーマーを特定するため、リアルタイムのハードウェア遅延フィードバックを用いた進化的探索を実施する。
  • 測定された遅延データに基づいて訓練された遅延予測器を統合し、探索プロセスを加速させるとともに、ハードウェアに配慮した最適化を保証する。
  • スーパートランスフォーマーのパフォーマンスプロキシを活用することで、各サブトランスフォーマーを再訓練する必要を回避し、探索コストを著しく削減する。
  • さらに効率性を向上させるために、量子化や知識蒸留などのモデル圧縮技術とHATを組み合わせる。

実験結果

リサーチクエスチョン

  • RQ1ハードウェアに配慮したニューラルアーキテクチャサーチは、CPU、GPU、エッジデバイスなどの多様なハードウェアプラットフォームにおいて、推論遅延を顕著に短縮できるか?
  • RQ2FLOPsの代わりに実際のハードウェア遅延フィードバックを用いることで、FLOPsベースの最適化に比べて、より優れたパフォーマンスと高い効率性を示すトランスフォーマーが得られるか?
  • RQ3重み共有のスーパートランスフォーマーは、広大なアーキテクチャ空間におけるサブネットワークのパフォーマンスを効果的に近似できるか? これにより、低コストなアーキテクチャ探索が可能になるか?
  • RQ4任意のエンコーダデコーダアテンションと異種のレイヤーの組み合わせは、異なるハードウェア上でモデルの効率性とパフォーマンスをどのように向上させるか?
  • RQ5HATは、Evolved Transformerのような従来のNASベースのアプローチに比べ、著しく低い探索コストで優れた効率性向上を達成できるか?

主な発見

  • WMT’14 En-De翻訳タスクにおいて、Raspberry Pi-4上でのHATは、Transformer-Bigに比べて3倍の高速化と3.7倍のモデルサイズ削減を達成したが、性能の損失はなかった。
  • 同じタスクにおいて、HATはEvolved Transformerに比べ12,041倍の低い探索コストを実現した一方で、2.7倍の高速化と3.6倍のモデルサイズ削減を達成した。
  • GPU向けに訓練されたHATモデルはARM CPU上で最適ではなく、逆にARM CPU向けに訓練されたモデルもGPU上で最適でないことが確認され、異なる遅延要因を考慮したハードウェア特化型最適化が不可欠であることが示された。
  • 4ビット量子化を適用した場合、WMT’14 En-Frタスクにおいてモデルサイズが25倍に削減されたが、フル精度ベースラインに比べてBLEUスコアはわずか0.1ポイント低下した。
  • 8ビット量子化されたHATモデルは、フル精度バージョンを0.1 BLEUスコア向上させ、探索プロセスの有効性を裏付けた。
  • 実際のハードウェア測定データに基づいて訓練された遅延予測器により、正確で迅速なフィードバックが可能となり、進化的探索が効率的かつハードウェアに配慮したものとなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。