Skip to main content
QUICK REVIEW

[논문 리뷰] Llumnix: Dynamic Scheduling for Large Language Model Serving

Biao Sun, Ziming Huang|arXiv (Cornell University)|2024. 06. 05.
Natural Language Processing Techniques인용 수 4
한 줄 요약

Llumnix는 메모리 상태의 효율적 라이브 마이그레이션을 통해 다수의 모델 인스턴스 간 런타임 요청 재스케줄링을 가능하게 하는 동적 스케줄링 시스템으로, 대규모 언어 모델(LLM) 서빙을 위한 것이다. 운영체제 유사한 컨텍스트 스위칭을 모방함으로써 꼬리 지연(latency)을 한 단계 개선하고, 고우선도 요청은 최대 1.5배 빠르게 처리하며, 최신 기술 수준의 시스템 대비 최대 36%의 비용 절감을 달성한다.

ABSTRACT

Inference serving for large language models (LLMs) is the key to unleashing their potential in people's daily lives. However, efficient LLM serving remains challenging today because the requests are inherently heterogeneous and unpredictable in terms of resource and latency requirements, as a result of the diverse applications and the dynamic execution nature of LLMs. Existing systems are fundamentally limited in handling these characteristics and cause problems such as severe queuing delays, poor tail latencies, and SLO violations. We introduce Llumnix, an LLM serving system that reacts to such heterogeneous and unpredictable requests by runtime rescheduling across multiple model instances. Similar to context switching across CPU cores in modern operating systems, Llumnix reschedules requests to improve load balancing and isolation, mitigate resource fragmentation, and differentiate request priorities and SLOs. Llumnix implements the rescheduling with an efficient and scalable live migration mechanism for requests and their in-memory states, and exploits it in a dynamic scheduling policy that unifies the multiple rescheduling scenarios elegantly. Our evaluations show that Llumnix improves tail latencies by an order of magnitude, accelerates high-priority requests by up to 1.5x, and delivers up to 36% cost savings while achieving similar tail latencies, compared against state-of-the-art LLM serving systems. Llumnix is publicly available at https://github.com/AlibabaPAI/llumnix.

연구 동기 및 목표

  • 작업장의 이질성과 실행의 예측 불가능성으로 인한 낮은 격리성, 메모리 분할, SLO 위반 문제를 해결한다.
  • 기존 LLM 서빙 시스템에서의 정적 스케줄링 및 일반적인 정책의 한계를 극복하여 다이나믹하고 다중 테넌트 워크로드를 효과적으로 처리하지 못하는 문제를 해결한다.
  • 실시간 워크로드 특성에 기반해 요청을 인스턴스 간 동적으로 재스케줄링하여 성능 격리성과 자원 활용 효율성을 향상시킨다.
  • 요청 우선순위와 SLO를 구분하여 시간 민감도가 높은 응용 프로그램의 처리 속도를 높이면서도 비용 효율성을 유지한다.
  • 로드 밸런싱, 분할 완화, 우선순위 차등화 등의 다양한 재스케줄링 시나리오를 하나의 확장 가능한 스케줄링 정책으로 통합한다.

제안 방법

  • 지속적인 추론 중 메모리 상태(예: KV 캐시)의 라이브 마이그레이션을 활용해 최소한의 정지 시간으로 런타임 재스케줄링을 가능하게 한다.
  • 요청 크기, 메모리 소비, 지연 목표 등 워크로드 다이나믹스에 반응하는 통합된 동적 스케줄링 정책을 설계한다.
  • 가상 머신의 라이브 마이그레이션을 영감으로 삼아 경량화되고 GPU에 최적화된 마이그레이션 메커니즘을 구현하여, 시퀀스 길이에 관계없이 마이그레이션 오버헤드를 최소화한다.
  • 런타임 모니터링을 통해 메모리 경쟁과 성능 간섭을 탐지하고, SLO 유지 및 로드 밸런싱을 위해 사전에 재스케줄링을 유도한다.
  • 단일 모델 및 다중 모델 서빙을 지원하기 위해 스케줄링 정책을 모델 변종 및 다양한 정밀도/크기 설정에까지 확장한다.
  • 기존 LLM 추론 엔진과 통합하여 후행 호환성을 확보하면서도 스케줄링 지능을 강화한다.

실험 결과

연구 질문

  • RQ1어떻게 다양한 메모리 및 지연 요구를 가진 예측 불가능하고 이질적인 워크로드를 효과적으로 관리할 수 있는가?
  • RQ2라이브 요청 마이그레이션이 다이나믹한 LLM 추론 환경에서 로드 밸런싱과 꼬리 지연 감소에 어느 정도 기여할 수 있는가?
  • RQ3통합된 스케줄링 정책이 성능 격리성, 메모리 분할 완화, 요청 우선순위 부여를 동시에 해결할 수 있는가?
  • RQ4다중 인스턴스 LLM 배포 환경에서 동적 재스케줄링이 비용 효율성과 자원 활용에 어떤 영향을 미치는가?
  • RQ5장기간 실행되는 순차적 추론 LLM 요청에 대해 라이브 마이그레이션의 성능 오버헤드는 얼마이며, 이를 극히 낮출 수 있는가?

주요 결과

  • Llumnix는 최신 기술 수준의 LLM 서빙 시스템 대비 꼬리 지연을 최대 한 단계 개선한다.
  • 고우선도 요청은 지능적인 스케줄링과 우선순위 부여 덕분에 최대 1.5배 빠른 처리 속도를 기록한다.
  • 유사한 꼬리 지연 수준을 유지하면서도 최대 36%의 비용 절감을 달성하여 자원 효율성이 향상됨을 입증한다.
  • 시퀀스 길이에 관계없이 라이브 마이그레이션이 극히 낮은 정지 시간을 유발하여 원활한 런타임 재스케줄링을 가능하게 한다.
  • 통합된 동적 스케줄링 정책은 로드 밸런싱, 분할 제어, 성능 격리성이라는 상충되는 목표를 효과적으로 조율한다.
  • 특히 급격하고 이질적인 요청 패턴에서 발생하는 예측 불가능한 워크로드를 다루는 데서 기존 시스템을 뛰어넘는 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.