Skip to main content
QUICK REVIEW

[论文解读] Efficient Interactive LLM Serving with Proxy Model-based Sequence Length Prediction

Haoran Qiu, Weichao Mao|arXiv (Cornell University)|Apr 12, 2024
Topic Modeling被引用 4
一句话总结

本文提出 SSJF,一种用于高效交互式 LLM 服务的推测最短作业优先调度器,通过使用轻量级代理模型预测输出序列长度,实现更优的请求调度。在真实世界数据集和生产追踪中评估,SSJF 在不修改内存或批处理机制的前提下,于无批处理、动态批处理和连续批处理设置下,将平均作业完成时间减少 30.5–39.6%,吞吐量提升 2.2–3.6 倍。

ABSTRACT

Large language models (LLMs) have been driving a new wave of interactive AI applications across numerous domains. However, efficiently serving LLM inference requests is challenging due to their unpredictable execution times originating from the autoregressive nature of generative models. Existing LLM serving systems exploit first-come-first-serve (FCFS) scheduling, suffering from head-of-line blocking issues. To address the non-deterministic nature of LLMs and enable efficient interactive LLM serving, we present a speculative shortest-job-first (SSJF) scheduler that uses a light proxy model to predict LLM output sequence lengths. Our open-source SSJF implementation does not require changes to memory management or batching strategies. Evaluations on real-world datasets and production workload traces show that SSJF reduces average job completion times by 30.5-39.6% and increases throughput by 2.2-3.6x compared to FCFS schedulers, across no batching, dynamic batching, and continuous batching settings.

研究动机与目标

  • 解决自回归 LLM 推理中因输出序列长度可变而导致的非确定性执行时间问题。
  • 减少依赖先进先出(FCFS)调度的 LLM 服务系统中的队首阻塞问题。
  • 在不修改内存管理或批处理策略的前提下,改善交互式 LLM 应用中的作业完成时间和系统吞吐量。
  • 实现对多种批处理设置的高效调度:无批处理、动态批处理和连续批处理。
  • 展示在真实世界 LLM 服务工作负载中,使用轻量级代理模型进行序列长度预测的可行性和性能提升。

提出的方法

  • 训练一个小型微调后的 BERT-base 代理模型,基于输入查询预测 LLM 推理请求的输出序列长度。
  • 利用预测的序列长度估算总执行时间,从而实现推测最短作业优先(SSJF)调度。
  • SSJF 调度器优先处理预测执行时间较短的请求,减少队首阻塞。
  • 代理模型与主 LLM 推理流水线独立运行,无需修改内存或键值缓存管理机制。
  • 系统支持多种批处理策略:无批处理、动态批处理和连续(迭代)批处理。
  • 在真实世界 LLM 对话数据(如 LMSYS-Chat-1M)上对代理模型进行再训练,以提升对多样化输入分布的预测准确性。
Figure 1 . SSJF overview.
Figure 1 . SSJF overview.

实验结果

研究问题

  • RQ1轻量级代理模型能否准确预测 LLM 推理请求的输出序列长度?
  • RQ2使用预测的序列长度实现推测最短作业优先(SSJF)调度,是否能减少 LLM 服务中的平均作业完成时间?
  • RQ3SSJF 在不同批处理策略下的表现如何,包括无批处理、动态批处理和连续批处理?
  • RQ4SSJF 是否能在不修改现有 LLM 服务系统中内存管理或批处理逻辑的前提下,提升系统吞吐量?
  • RQ5与自提示(self-prompting)或在小数据集上进行回归等替代方法相比,基于代理模型的预测方法有哪些性能优势?

主要发现

  • 在所有评估的批处理设置下,SSJF 相较于 FCFS 调度,将平均作业完成时间减少了 30.5–39.6%。
  • 在使用 SSJF 而非 FCFS 时,系统吞吐量在不同请求速率和突发性水平下提升了 2.2–3.6 倍。
  • 代理模型在真实世界 LLM 对话数据上实现了高预测准确性,基于回归的预测方法优于多分类分类方法。
  • 该方法在多种批处理策略下均有效,包括无批处理、动态批处理和连续批处理,且无需修改内存或缓存管理机制。
  • 基于代理模型的方法在长度预测方面优于自提示 LLM,避免了偏差并降低了开销。
  • 开源的 SSJF 实现展示了在真实生产工作负载追踪和主流开源 LLM 上的一致性能提升。
Figure 2 . Output length predictor architecture.
Figure 2 . Output length predictor architecture.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。