[論文レビュー] MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging
MergePipe は LLM のマージをデータ管理問題として扱い、予算対応の計画とカタログ主導の実行エンジンを導入して専門家パラメータ読み取りを制限し、ナイーブなパイプラインと比較して I/O とウォールタイムを大幅に削減します。
Large language model (LLM) merging has become a key technique in modern LLM development pipelines, enabling the integration of multiple task- or domain-specific expert models without retraining. However, as the number of experts grows, existing merging implementations treat model parameters as unstructured files and execute merges in a stateless, one-shot manner, leading to excessive disk I/O, redundant parameter scans, and poor scalability. In this paper, we present extbf{MergePipe}, a parameter management system for scalable LLM merging. MergePipe is the first system that treats LLM merging as a data management and execution problem, and introduces a catalog-driven abstraction over model parameters, merge plans, and execution lineage. At its core, MergePipe employs a cost-aware planner that explicitly models expert parameter I/O and enforces user-specified I/O budgets, followed by a streaming execution engine that materializes merged models under transactional guarantees. Our key insight is that while base model reads and output writes are unavoidable, expert parameter reads dominate merge cost and constitute the primary optimization target. By making expert access budget-aware throughout planning and execution, MergePipe mitigates the $O(K)$ I/O growth of naive pipelines and achieves predictable scaling behavior. Experiments show that MergePipe reduces total I/O by up to an order of magnitude and delivers up to $11 imes$ end-to-end speedups (up to 90\% wall-time reduction) over state-of-the-art LLM merging pipelines.
研究の動機と目的
- ナイーブなパイプラインでの専門家読み取り I/O を支配的なコストとして特定し、スケーラブルな LLM マージを動機づける。
- ストレージ、計画、実行を分離するカタログ主導かつ予算対応のシステムを提案し、反復的マージを実現する。
- ユーザー指定の I/O 予算の下で融合されたチェックポイントの再利用、出典 provenance、トランザクショナルマテリアライズを有効にする。
提案手法
- パラメータブロック、マージ計画、実行系の系統を第一級データオブジェクトとしてモデル化する永続カタログを導入する。
- ベース/読み取り/書き込みコストを専門家読み取りコストから分離し、専門家 I/O を予算化されたリソースとして表現するコストモデルを開発する。
- ダイジェストされたカタログメタデータからの競合認識信号に導かれて、ユーザー指定の専門家 I/O 予算の下でパラメータブロックを選択する予算対応プランナーを設計する。
- トランザクショナル保証と厳密な計画遵守の下で融合済みチェックポイントをマテリアライズするストリーミング実行エンジン(DeltaIterator)を実装する。
- 再現可能で監査可能なマージのための原子的公開とマニフェストベースの系統を提供する。

実験結果
リサーチクエスチョン
- RQ1専門家パラメータ読み取りを予算化されたリソースとしてモデル化して、LLM マージにおける I/O 成長を制限できるか。
- RQ2予算対応の計画と実行は、多様なマージ演算子とモデルサイズにわたって予測可能なスケーリングを可能にするか。
- RQ3反復的マージワークフローにおける計画オーバーヘッド、再利用、実行コストのトレードオフはどうなるか。
主な発見
- 専門家リーダーはマージコストを支配し、ナイーブなパイプラインでは専門家の数に比例して線形に増加する。
- 明示的な専門家 I/O 予算を適用すると、専門家数が増えても専門家読み取りがほぼ一定となり、ウォールタイムを削減する。
- 予算が専門家アクセスを制約するにつれて、総 I/O は専門家読み取りからベース読み取りと出力書き込みへとシフトする。
- MergePipe は総 I/O を最大で1桁のオーダーの削減と、最先端パイプラインに対して最大 11x のエンドツーエンドの速度向上(最大 90% のウォールタイム削減)を達成する。
- 計画、メタデータ管理、およびトランザクショナル実行は、反復的マージワークフローで償却される小さなオーバーヘッドを発生させる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。