Skip to main content
QUICK REVIEW

[论文解读] Fairness in Serving Large Language Models

Ying Sheng, Shiyi Cao|arXiv (Cornell University)|Dec 31, 2023
Distributed and Parallel Computing Systems被引用 4
一句话总结

本文提出虚拟令牌计数器(VTC),一种用于大语言模型(LLM)推理服务的新型公平调度算法,通过跟踪每个客户端的累积服务量,实现在令牌层面的公平性。在工作保持条件下,VTC实现了客户端间服务差异的2倍紧致上界,相较于FCFS和基于RPM的方法,在不同请求长度和系统负载下均展现出更优的公平性和资源利用率。

ABSTRACT

High-demand LLM inference services (e.g., ChatGPT and BARD) support a wide range of requests from short chat conversations to long document reading. To ensure that all client requests are processed fairly, most major LLM inference services have request rate limits, to ensure that no client can dominate the request queue. However, this rudimentary notion of fairness also results in under-utilization of the resources and poor client experience when there is spare capacity. While there is a rich literature on fair scheduling, serving LLMs presents new challenges due to their unpredictable request lengths and their unique batching characteristics on parallel accelerators. This paper introduces the definition of LLM serving fairness based on a cost function that accounts for the number of input and output tokens processed. To achieve fairness in serving, we propose a novel scheduling algorithm, the Virtual Token Counter (VTC), a fair scheduler based on the continuous batching mechanism. We prove a 2x tight upper bound on the service difference between two backlogged clients, adhering to the requirement of work-conserving. Through extensive experiments, we demonstrate the superior performance of VTC in ensuring fairness, especially in contrast to other baseline methods, which exhibit shortcomings under various conditions. The reproducible code is available at https://github.com/Ying1123/VTC-artifact

研究动机与目标

  • 解决LLM服务中的公平性挑战,其中请求长度不可预测,且输入/输出令牌的资源使用量因处理成本而异。
  • 克服传统速率限制(如RPM)的局限性,后者在空闲容量期间导致资源利用率低下和客户端体验差。
  • 设计一种调度算法,在存在可变请求长度和批处理动态的情况下,确保客户端间的服务分配公平,同时保持高GPU利用率。
  • 基于输入和输出令牌处理的可配置成本函数,形式化LLM服务中的公平性定义。
  • 开发一种对服务器容量波动不敏感的调度器,并能与连续批处理和现代LLM推理优化无缝集成。

提出的方法

  • 提出一种成本函数,根据处理成本为输入和输出令牌分配不同权重,实现在令牌层面的细粒度公平性。
  • 引入虚拟令牌计数器(VTC)算法,为每个客户端维护一个累积服务量计数器,以令牌粒度持续更新。
  • 使用优先队列调度累积服务量最低(计数器最小)的客户端,确保工作保持行为和公平性。
  • 采用动态计数器更新机制,通过基于当前进度估算未来服务,来应对输出长度未知的问题,避免过度补偿。
  • 原生集成连续批处理和PagedAttention,实现高效GPU利用率,同时不牺牲公平性保证。
  • 理论分析证明,在任意两个排队客户端之间,服务差异存在2倍的紧致上界,确保在工作保持约束下的强公平性。

实验结果

研究问题

  • RQ1在请求长度可变且输入与输出令牌处理成本不同的情况下,如何有意义地定义LLM服务中的公平性?
  • RQ2何种调度机制可在输出长度不可预测且GPU容量动态变化的情况下,确保公平性并维持高资源利用率?
  • RQ3能否设计一种调度器,既具备工作保持特性,又能抵御服务器容量波动和请求异构性的影响?
  • RQ4在多样化工作负载下,所提出的VTC调度器与FCFS和基于RPM的调度相比,在公平性和资源利用率方面表现如何?
  • RQ5在VTC调度下,客户端间的服务差异理论边界是什么?与最优公平性边界相比如何?

主要发现

  • VTC在任意两个排队客户端之间实现了服务差异的2倍紧致上界,证明了在工作保持条件下具有强公平性保证。
  • 大量实验表明,VTC在公平性方面显著优于FCFS和基于RPM的调度,尤其在高负载和可变请求长度下。
  • 服务差异的方差随内存池增大和请求长度变长而增加,验证了理论分析,并凸显了未知输出长度的影响。
  • 仅使用输入令牌进行计数器更新会导致对短请求的过度补偿,而VTC通过引入估计的输出令牌成本有效缓解了该问题。
  • 即使在GPU处理速率因内存限制而波动时,VTC仍能保持公平性,证明了其对动态系统行为的鲁棒性。
  • 该算法能与现有LLM服务优化技术(如连续批处理和PagedAttention)无缝集成,实现无需架构重构的实际部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。