Skip to main content
QUICK REVIEW

[論文レビュー] PowerInfer-2: Fast Large Language Model Inference on a Smartphone

Zhenliang Xue, Yixin Song|arXiv (Cornell University)|Jun 10, 2024
Topic Modeling被引用数 4
ひとこと要約

PowerInfer-2 は、大規模言語モデル(最大470億パラメータ)をスマートフォン上で高速かつオンデバイスで推論可能にするフレームワークである。行列計算を細粒度のニューロンクラスタ演算に分解し、CPU、GPU、NPUといった異種ハードウェアを活用する多態性ニューロンエンジンと、セグメント化キャッシュおよびパイipelニングによるI/O最適化を実現している。最新の最先端システムと比較して最大29.2倍の高速化を達成し、スマートフォン上でTurboSparse-Mixtral-47Bを11.68トークン/秒の速度で実行した初のシステムである。

ABSTRACT

Large language models (LLMs) on smartphones enable real-time AI assistance and privacy-preserving, offline operation. However, resource constraints of smartphones limit current deployments to small language models (SLMs), significantly compromising their capabilities. This paper introduces PowerInfer-2, a smartphone-based framework that enables fast inference for LLMs exceeding the memory capacity. The key insight is decomposing matrix operations into neuron clusters as the basic processing unit, which enables flexible scheduling and efficient I/O-computation pipelining. PowerInfer-2 leverages this neuron-cluster-based design in both computation and storage. For computation, neuron clusters with dense activations are processed on NPU, while sparse clusters use CPU. The storage engine provides a fine-grained pipeline mechanism that coordinates cluster-level computation and I/O operations, enhanced by a segmented neuron cache to reduce I/O activities. PowerInfer-2 achieves up to a 27.8x speed increase compared to state-of-the-art frameworks. PowerInfer-2 is the first system to serve a 47B LLM on a smartphone, achieving 11.68 tokens/s. Notably, these performance improvements preserve model quality with negligible accuracy degradation.

研究の動機と目的

  • スマートフォン上で、デバイスメモリ容量を超えるモデルでも高速かつオンデバイスでの大規模言語モデル(LLM)推論を可能にすること。
  • モデル重みの取得時に発生する制限されたストレージ帯域幅と単一のコマンドキューによるI/Oボトル neck を克服すること。
  • スマートフォン内に統合された異種XPUリソース(CPU、GPU、NPU)を効果的に活用して、効率的なLLM推論を実現すること。
  • 高い推論速度を維持したまま、メモリ内モデルのメモリ使用量を削減すること。
  • TurboSparse-Mixtral-47Bのような極めて大きなMoEモデルを、初めてモバイルデバイスでリアルタイム性能で実行可能にすること。

提案手法

  • LLM推論における粗粒度の行列計算を、スマートフォンのハードウェア特性に適合した細粒度のニューロンクラスタ演算に分解する。
  • 大規模クラスタをプレフィル(NPU最適化)に、小規模クラスタをデコード(CPU最適化)に適応する動的計算パターンを備えた多態性ニューロンエンジンを導入する。
  • ニューロンクラスタレベルでのセグメント化ニューロンキャッシュを採用し、タイプに特化した戦略を用いてキャッシュヒット率を向上させ、I/Oオーバーヘッドを低減する。
  • 細粒度のニューロンクラスタレベルでのパイプライン処理を用い、I/O操作と計算を重ねて実行することで、I/O遅延を効果的に隠蔽する。
  • LLMにおける活性化スパarsityを活用し、頻繁に使用されるニューロンをメモリにキャッシュし、あまり使われないニューロンをフラッシュストレージにオフロードする。
  • メモリオーバーフローとメモリ内推論の両方のシナリオをサポートし、動的ウェイトオフロードとメモリ最適化を実現する。
(a)
(a)

実験結果

リサーチクエスチョン

  • RQ1470億パラメータを超えるモデルに対しても、スマートフォン上で高速なLLM推論を実現できるフレームワークは存在するか?
  • RQ2スマートフォンでのLLM推論を高速化するために、異種XPUリソース(CPU、GPU、NPU)を効果的に活用する方法は何か?
  • RQ3スマートフォンでのLLM推論において、フラッシュストレージからのI/Oオーバーヘッドをどの程度低減または隠蔽できるか?
  • RQ4推論速度を損なわずに、メモリ内モデルのメモリ使用量を著しく削減できるか?
  • RQ5TurboSparse-Mixtral-47Bのような極めて大きなMoEモデルを、スマートフォン上でリアルタイム性能で実行することは可能か?

主な発見

  • PowerInfer-2 は、2台のスマートフォンでメモリオーバーフロー推論において、最新の最先端フレームワークと比較して最大29.2倍の高速化を達成した。
  • PowerInfer-2 は、スマートフォン上でTurboSparse-Mixtral-47Bモデルを実行可能な初のシステムであり、生成レートは1秒あたり11.68トークンを達成した。
  • メモリ内モデルでは、PowerInfer-2 は性能が llama.cpp や MLC-LLM と同等のまま、約40%のメモリ使用量削減を実現した。
  • FFN重みの50%をオフロードした場合、PowerInfer-2 は TurboSparse-Mistral-7B モデルで約1.5GBのメモリ節約が可能である一方、llama.cpp は20.8倍の性能低下を示し、MLC-LLM は実行不能となった。
  • 1トークンあたりのニューロンキャッシュミス率の平均は3.5%であるが、P99ミス率は18.9%に達しており、活性化の類似度の差による高い変動性が示された。
  • TurboSparse-Mixtral-47B のデコード遅延は、平均99.76ms、P99で140.56msであり、活性化パターンとキャッシュ動作に起因する顕著な変動が見られた。
(b)
(b)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。