Skip to main content
QUICK REVIEW

[論文レビュー] Petals: Collaborative Inference and Fine-tuning of Large Models

Alexander Borzunov, Dmitry Baranchuk|arXiv (Cornell University)|Sep 2, 2022
Topic Modeling被引用数 6
ひとこと要約

Petalsは、インターネットを介して複数の参加者のGPUにモデルレイヤーを分散させることで、大規模言語モデル(例:BLOOM-176B)の共同推論およびファインチューニングを可能にする。動的ロードバランシング、8ビット量子化、低遅延ルーティングを活用し、コンsumerハードウェアでも1秒あたり約1トークンの推論を達成する。同時に、アダプターやプロンプトチューニングを介して研究水準のファインチューニングが可能な隠れ状態を公開する。

ABSTRACT

Many NLP tasks benefit from using large language models (LLMs) that often have more than 100 billion parameters. With the release of BLOOM-176B and OPT-175B, everyone can download pretrained models of this scale. Still, using these models requires high-end hardware unavailable to many researchers. In some cases, LLMs can be used more affordably via RAM offloading or hosted APIs. However, these techniques have innate limitations: offloading is too slow for interactive inference, while APIs are not flexible enough for research that requires access to weights, attention or logits. In this work, we propose Petals - a system for inference and fine-tuning of large models collaboratively by joining the resources of multiple parties. We demonstrate that this strategy outperforms offloading for very large models, running inference of BLOOM-176B on consumer GPUs with $\approx$ 1 step per second, which is enough for many interactive LLM applications. Unlike most inference APIs, Petals also natively exposes hidden states of served models, allowing to train and share custom model extensions based on efficient fine-tuning methods.

研究の動機と目的

  • BLOOM-176B や OPT-175B のような数百億パラメータを持つ言語モデルを実行するための高い計算コストとメモリコストに対処すること。
  • RAM/SSDオフロードの限界(インタラクティブ利用には遅すぎる)およびホストドAPIの限界(内部状態へのアクセスや柔軟性に欠ける)を克服すること。
  • 高価なハードウェアや信頼できる中央サーバーを必要とせずに、研究者や実務家が共同で推論とパラメータ効率の良いファインチューニングを実行できるようにすること。
  • モデルハブを通じてファインチューニングされたモデル拡張(例:アダプター)を共有し、共同でのモデル改善を可能にすること。

提案手法

  • 複数の参加者のGPUにモデルレイヤーを分散し、クライアントがサーバーのチェーンを形成してパイプライン並列方式で推論を実行する。
  • 8ビット量子化を用いてメモリ要件を削減し、コンsumerクラスのGPUでも推論を可能にする。
  • 低遅延のサーバーチェーンを選択し、サーバー間で負荷をバランスさせる動的ルーティングを採用して推論遅延を最小限に抑える。
  • アダプターとプロンプトチューニングを介したパラメータ効率の良いファインチューニングをサポートし、訓練済みのサブモジュールをモデルハブに共有する。
  • 推論中に隠れ状態とアテンションメカニズムを公開し、研究レベルの分析やカスタマイズを可能にする。
  • 入力と出力を暗号的ハッシュ化することで、悪意あるまたは不正なサーバーを検出・抑止する仕組みを提供し、正しさに対する経済的インcentiveを導入する。

実験結果

リサーチクエスチョン

  • RQ11000億パラメータを超える大規模言語モデルを、コンsumerグレードのGPUのみを用いて協働分散により効率的かつインタラクティブに推論することは可能か?
  • RQ2分散型推論システムにおいて、隠れ状態とアテンションメカニズムをどのように公開すれば、研究水準のファインチューニングを可能にするか?
  • RQ3分散型ハードウェア上でインタラクティブな推論速度を達成するために、必要なシステムレベルの最適化(例:ルーティング、量子化、ロードバランシング)は何か?
  • RQ4ファインチューニングされたモデル拡張(例:アダプター)を分散ネットワーク上の参加者間で安全に共有・再利用するにはどうすればよいか?
  • RQ5信頼できない分散型推論環境で正しさを保証し、不正行為を防ぐにはどのようなメカニズムが必要か?

主な発見

  • Petalsは、コンsumer GPUのみを用いてBLOOM-176Bのインタラクティブ推論を1秒あたり約1トークンの速度で実現し、RAMオフロードを上回る性能を発揮する。
  • この性能は、8ビット量子化、動的低遅延ルーティング、分散サーバー間での効率的なロードバランシングによって達成される。
  • 推論中に隠れ状態とアテンションメカニズムがネイティブに公開されており、プロンプトチューニングやアダプター学習を含む高度な研究用途を可能にする。
  • アダプターとプロンプトチューニングのようなパラメータ効率の良いファインチューニング手法を共同で実行でき、モデルハブを通じて共有可能であり、コミュニティ主導のモデル適合を可能にする。
  • 入力と出力の暗号的ハッシュ化により、悪意あるまたは不正なサーバーを検出・抑制する検証可能なメカニズムが提供され、システムの整合性が向上する。
  • バージョン管理されたモデルアップデートとファインチューニング済みアダプターのタグ付けをサポートしており、将来のモデルバージョニングおよび段階的改善のサポートが可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。