Skip to main content
QUICK REVIEW

[論文レビュー] Mixture of Experts with Mixture of Precisions for Tuning Quality of Service

HamidReza Imani, Abdolah Amirany|arXiv (Cornell University)|Jul 19, 2024
Engineering Technology and Methodologies被引用数 4
ひとこと要約

本稿では、CPUおよびGPU上で16ビットと4ビットの混合精度量子化を動的に制御することで、スループットとモデル品質のチューニングが可能な、Mixture-of-Experts (MoE) モデル向けの適応的サービングフレームワークを提案する。専門家層のみを部分的に量子化することにより、最大量子化条件下でもWikiText2でペルプレックスが2.62~2.80上昇するのみで、A100 GPU上で最大13.00トークン/秒のスループットを達成し、リソース制約があり変動する環境における細分化されたトレードオフを可能にする。

ABSTRACT

The increasing demand for deploying large Mixture-of-Experts (MoE) models in resource-constrained environments necessitates efficient approaches to address their high memory and computational requirements challenges. Moreover, given that tasks come in different user-defined constraints and the available resources change over time in multi-tenant environments, it is necessary to design an approach which provides a flexible configuration space. This paper presents an adaptive serving approach for the efficient deployment of MoE models, capitalizing on partial quantization of the experts. By dynamically determining the number of quantized experts and their distribution across CPU and GPU, our approach explores the Pareto frontier and offers a fine-grained range of configurations for tuning throughput and model quality. Our evaluation on an NVIDIA A100 GPU using a Mixtral 8x7B MoE model for three language modelling benchmarks demonstrates that the throughput of token generation can be adjusted from 0.63 to 13.00 token per second. This enhancement comes with a marginal perplexity increase of 3.81 to 4.00, 13.59 to 14.17, and 7.24 to 7.40 for WikiText2, PTB, and C4 datasets respectively under maximum quantization. These results highlight the practical applicability of our approach in dynamic and accuracy-sensitive applications where both memory usage and output quality are important.

研究の動機と目的

  • リソース制約があり、マルチテント環境下での大規模MoEモデルのデプロイに伴う高いメモリおよび計算オーバーヘッドに対処すること。
  • ユーザー制約や利用可能なGPUメモリの変動に応じて、モデルのスループットと出力品質を動的に設定できること。
  • 専門家層のみを選択的に量子化することで、CPUとGPU間のデータ移動ボトルネックを軽減すること。
  • 実行時におけるシステム状態の変化に応じた柔軟な再構成が可能な、細分化された構成空間を提供すること。

提案手法

  • 本手法は部分的量子化を採用し、非専門家層は16ビットのままに保ちつつ、専門家の前向きフィードフォワード層のみを4ビットまたは16ビット精度に量子化する。
  • 利用可能なメモリとパフォーマンス目標に基づき、4ビット専門家の数とそのCPUおよびGPUへの配置割り当てを動的に決定する。
  • 専門家は可能な限りGPUにロードし、必要に応じてCPUにオフロードするハイブリッド実行モデルを採用し、データ移動を最小限に抑える。
  • メモリフットプリント、計算量、モデル品質のバランスを取るために、配置のパレートフロンティアを探索することでスループットとペルプレックスを最適化する。
  • PyTorchのテンソル演算を活用し、最小限のランタイムオーバーヘッドで混合精度推論を実現する。
  • モデルサービングを推論時において再構成可能にし、再トレーニングなしで実行時における再設定が可能である。

実験結果

リサーチクエスチョン

  • RQ1リソース利用状況やユーザー制約が変動する動的かつ単一GPU環境下で、MoEモデルをどのように効率的に提供できるか?
  • RQ2専門家層の部分的量子化(4ビット対16ビット)がモデルのペルプレックスと推論スループットに与える影響は何か?
  • RQ3CPU/GPU間の混合場所に配置された混合精度専門家戦略は、モデル品質とスループットの間で細分化されたトレードオフを達成できるか?
  • RQ4量子化された専門家の構成空間は、MoE推論のメモリフットプリントとパフォーマンスにどのように影響するか?

主な発見

  • NVIDIA A100 GPU上でのメモリ制約の変動に応じ、トークン生成のスループットは0.63~13.00トークン/秒の範囲で変動する。
  • 最大量子化条件下でもペルプレックスの上昇はわずかにとどまる:WikiText2では2.62~2.80、PTBでは6.48~7.24、C4では3.24~3.53。
  • モデルサイズは16ビット完全版の94.21 GBから、完全に4ビット量子化された専門家を用いた場合23.55 GBまで削減され、WikiText2ではペルプレックスが2.62上昇するにとどまる。
  • 適応的アプローチにより、モデルサイズは75%削減(94.21 GB → 23.55 GB)され、全ベンチマークでペルプレックス上昇が10%未満に抑えられる。
  • 利用可能なGPUメモリと量子化専門家の数が増加する際、スループットが双曲的(ハイパボリック)に増加する傾向を示しており、メモリボトルネックの効果的緩和が確認された。
  • 同種の量子化ベースラインに比べ、モデルサイズ、スループット、出力品質のバランスにおいて優れたトレードオフを実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。