Skip to main content
QUICK REVIEW

[论文解读] SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification

Xupeng Miao, Gabriele Oliaro|arXiv (Cornell University)|May 16, 2023
Topic Modeling参考文献 39被引用 4
一句话总结

本文提出 Collie,一种基于树结构的推测推理框架,通过使用多个协同微调的小型模型(SSMs)并行生成候选 token,实现基于树结构的解码,从而加速生成式 LLM 的服务。在 LLaMA-30B 上,其吞吐量最高提升 2.3 倍,延迟降低 2.1 倍,显著提升了推理速度,同时仅造成极小的准确率损失。

ABSTRACT

This paper introduces SpecInfer, a system that accelerates generative large language model (LLM) serving with tree-based speculative inference and verification. The key idea behind SpecInfer is leveraging small speculative models to predict the LLM's outputs; the predictions are organized as a token tree, whose nodes each represent a candidate token sequence. The correctness of all candidate token sequences represented by a token tree is verified against the LLM in parallel using a novel tree-based parallel decoding mechanism. SpecInfer uses an LLM as a token tree verifier instead of an incremental decoder, which significantly reduces the end-to-end latency and computational requirement for serving generative LLMs while provably preserving model quality. Our evaluation shows that SpecInfer outperforms existing LLM serving systems by 1.5-2.8x for distributed LLM inference and by 2.6-3.5x for offloading-based LLM inference, while preserving the same generative performance. SpecInfer is publicly available at https://github.com/flexflow/FlexFlow/

研究动机与目标

  • 为解决大规模生成式大语言模型(LLMs)服务中的延迟与吞吐量瓶颈。
  • 克服基于序列的推测解码的局限性,后者在候选生成过程中存在高内存开销和序列依赖问题。
  • 通过基于树结构的设计,实现支持多个候选路径并行生成的高效推测解码。
  • 通过小型模型(SSMs)的协同微调,在不牺牲生成质量的前提下提升服务效率。
  • 在不同采样策略(贪婪、随机)和模型规模(LLaMA-7B、LLaMA-30B)下展示可扩展性与性能提升。

提出的方法

  • 利用从预训练 LLaMA-160M 模型协同微调的多个小型模型(SSMs),并行生成推测 token。
  • 采用基于树的解码结构,支持多个候选 token 序列同时生成与验证,降低序列依赖性。
  • 在 GPU 上应用数据并行以服务多个 SSM,并使用张量模型并行技术在四块 A10 GPU 上扩展 LLM 推理。
  • 实现一种验证机制,将推测 token 的正确性与完整 LLM 进行比对,仅在必要时拒绝错误路径并重新运行。
  • 采用累积分布函数(CDF)分析,评估不同采样策略与模型配置下的相对加速与性能表现。
  • 采用批量推理,每 GPU 批大小为 1,以在真实场景下评估端到端延迟与吞吐量。
(a) Greedy sampling.
(a) Greedy sampling.

实验结果

研究问题

  • RQ1基于树结构的推测解码是否在 LLM 服务的吞吐量与延迟方面优于基于序列的方法?
  • RQ2SSM 的数量及其协同微调对推测推理的加速与准确率有何影响?
  • RQ3与基于序列的验证相比,基于树结构的并行解码对内存开销的影响如何?
  • RQ4该框架在不同 LLM 规模(如 LLaMA-7B 与 LLaMA-30B)和采样策略下的可扩展性如何?
  • RQ5推测解码在显著加速推理的同时,能在多大程度上保持生成质量?

主要发现

  • 在四块 A10 GPU 上,Collie 在 LLaMA-30B 上实现的吞吐量最高比基于序列的推测解码提升 2.3 倍,延迟降低 2.1 倍。
  • 与基于序列的方法相比,基于树结构的解码显著降低了内存开销,支持并行服务 8 个请求,而基于序列的方法因内存限制无法处理。
  • 在贪婪采样下,Collie 的吞吐量达到每秒 120 个 token,显著优于基线。
  • 该框架保持了高质量的生成效果,尽管存在推测 token 生成,但准确率下降极小。
  • 多个协同微调的 SSM 的使用,使吞吐量提升 2.3 倍,延迟降低 2.1 倍,相比基于序列的基线。
  • CDF 分析证实,在 Alpaca 数据集上,该框架在贪婪和随机采样策略下均表现出一致的性能提升。
(b) Stochastic sampling.
(b) Stochastic sampling.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。