Skip to main content
QUICK REVIEW

[論文レビュー] DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale

Reza Yazdani Aminabadi, Samyam Rajbhandari|arXiv (Cornell University)|Jun 30, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

DeepSpeed Inference は、多様なハードウェア上で大規模な密行列およびスパース(Mixture-of-Experts)トランスフォーマー モデルの効率的かつスケーラブルな推論を統合的に実現するシステムを提供する。マルチGPU最適化、ZeRO-Inference を用いたCPU/NVMeオフロード、および特化したカーネルを組み合わせることで、最先端の技術と比較して最大7.3倍の低遅延、1.5倍の高いスループットを達成し、数百のGPUでリアルタイム遅延を満たすトランジリオンパラメータモデルの推論を可能にする。

ABSTRACT

The past several years have witnessed the success of transformer-based models, and their scale and application scenarios continue to grow aggressively. The current landscape of transformer models is increasingly diverse: the model size varies drastically with the largest being of hundred-billion parameters; the model characteristics differ due to the sparsity introduced by the Mixture-of-Experts; the target application scenarios can be latency-critical or throughput-oriented; the deployment hardware could be single- or multi-GPU systems with different types of memory and storage, etc. With such increasing diversity and the fast-evolving pace of transformer models, designing a highly performant and efficient inference system is extremely challenging. In this paper, we present DeepSpeed Inference, a comprehensive system solution for transformer model inference to address the above-mentioned challenges. DeepSpeed Inference consists of (1) a multi-GPU inference solution to minimize latency while maximizing the throughput of both dense and sparse transformer models when they fit in aggregate GPU memory, and (2) a heterogeneous inference solution that leverages CPU and NVMe memory in addition to the GPU memory and compute to enable high inference throughput with large models which do not fit in aggregate GPU memory. DeepSpeed Inference reduces latency by up to 7.3X over the state-of-the-art for latency-oriented scenarios and increases throughput by over 1.5x for throughput-oriented scenarios. Moreover, it enables trillion parameter scale inference under real-time latency constraints by leveraging hundreds of GPUs, an unprecedented scale for inference. It can inference 25x larger models than with GPU-only solutions, while delivering a high throughput of 84 TFLOPS (over $50\%$ of A6000 peak).

研究の動機と目的

  • メモリ制約や遅延制約が異なる異種ハードウェア上で、密度型からMoEアーキテクチャに至るまで多様な大規模トランスフォーマー モデルの展開という、ますます深刻化する課題に対処すること。
  • 小バッチ・遅延制限のワークロードに最適でない既存の推論システムが、GPUメモリ容量を超えて効率的にスケーリングできないという限界を克服すること。
  • GPUメモリに収まりきらないモデルに対して、CPUおよびNVMeストレージをメモリ階層の延長として活用することで、高スループット・低遅延の推論を実現すること。
  • マルチGPUおよび異種システムにおける動的スケジューリング、カーネル最適化、メモリ管理を通じて、遅延に敏感なワークロードとスループット指向のワークロードの両方をサポートすること。

提案手法

  • ZeRO-Inference を導入し、モデルパラメータをCPUまたはNVMeストレージにオフロードしながら、アクティベーションをGPUメモリに保持することで、GPUメモリ容量を超えるモデルの推論を可能にする。
  • DeepFusion を活用し、複数のオペレータ(例:線形、レイヤーノーマライゼーション、ソフトマックス)を1つのカーネルに統合・融合することで、小バッチサイズにおけるカーネル起動およびデータ移動のオーバーヘッドを低減し、遅延を改善する。
  • 推論ワークロードに最適化されたGeMMカーネルを採用し、特に帯域幅がボトルネックとなる小バッチ推論において、メモリ帯域幅の利用を最大化する。
  • パイプライン並列とテンソル並列を統合したハイブリッドスケジューリングを採用し、動的負荷分散によりすべてのデバイスを常に稼働状態に保つ。特に、各トークンが直前のトークンに依存する自己回帰的生成において重要である。
  • すべてのデバイス間通信最適化とエキスパート並列化を活用し、数百のGPUにわたるスパースなMoEモデルを、高いメモリ帯域幅スケーラビリティを実現しながら効率的にスケーリングする。
  • 複数のGPUに跨るPCIe帯域幅集約により、ほぼ線形のスループットスケーリングを達成し、巨大なモデルに対しても高スループット推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1大規模なトランスフォーマー モデル(さまざまなモデルサイズおよびスパarsityを有する)に対して、遅延制限のワークロードとスループット指向のワークロードの両方を、効率的にサポートするにはどうすればよいか?
  • RQ2小バッチサイズにおいて推論遅延がメモリ帯域幅に依存する状況で、高いメモリ帯域幅利用率と低いカーネル起動オーバーヘッドを達成するには、どのようなシステムレベルの最適化が必要か?
  • RQ3スループットや許容可能な遅延に悪影響を及げることなく、CPUおよびNVMeストレージにモデルパラメータを効果的にオフロードするにはどうすればよいか?
  • RQ4自己回帰的生成(各トークンが直前のトークンに依存する)において、デバイスの利用率を高維持するには、どのような並列化戦略とスケジューリング技術が必要か?
  • RQ5異種メモリ(GPU、CPU、NVMe)と混合精度計算を用いた場合、数百のGPUにわたる推論性能はどの程度スケーリング可能か?

主な発見

  • DeepSpeed Inference は、遅延制限のシナリオにおいて、最先端技術と比較して最大7.3倍の遅延低減を達成しており、主にカーネル統合と最適化されたメモリアクセスによるものである。
  • スループット指向のワークロードでは、ZeRO-Inference によるCPU/NVMeオフロードのおかげで、GPUメモリに収まるモデルですら大幅に大きなバッチサイズを可能にし、スループットが1.5倍以上向上した。
  • 数百のGPUを用いて、リアルタイム遅延制約のもとでトランジリオンパラメータのモデル推論を実現し、84 TFLOPS(A6000のピークの50%以上)のスループットを達成した。
  • CPUメモリに収まるモデルに対しては、ZeRO-Inference がCPUオンリーオフロードと比較して25倍以上のスループット向上を示し、ハイブリッドメモリオフロードの有効性を実証した。
  • 8× A100 ノード環境では、ハイブリッドスケジューリングにより、FasterTransformer と比較してプロンプト処理の遅延がPP+MPで1.18倍、MPオンリーで3.06倍改善され、自己回帰的推論速度の向上が顕著に確認された。
  • スパースなMoEモデルにおいて、DeepSpeed Inference は、PyTorchのベースラインを上回る優れたメモリ帯域幅スケーラビリティを実現し、最適化されたすべてのデバイス間通信およびMoEカーネルのおかげで、128 GPUまで高い帯域幅を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。