[논문 리뷰] Efficient Interactive LLM Serving with Proxy Model-based Sequence Length Prediction
이 논문은 실시간 대화형 LLM 서빙에서 효율적인 요청 스케줄링을 위해 경량 프oxy 모델을 사용해 출력 시퀀스 길이를 예측하는 SSJF(의사결정 최단작업 우선 스케줄러)를 제안한다. 실제 워크로드 데이터셋과 생산 환경 트레이스에서 평가한 결과, 배치 처리 방식(배치 없음, 동적 배치, 지속적 배치) 전반에서 평균 작업 완료 시간을 30.5–39.6% 감소시키고, 메모리나 배치 처리 메커니즘을 수정하지 않고도 처리량을 2.2–3.6배 증가시켰다.
Large language models (LLMs) have been driving a new wave of interactive AI applications across numerous domains. However, efficiently serving LLM inference requests is challenging due to their unpredictable execution times originating from the autoregressive nature of generative models. Existing LLM serving systems exploit first-come-first-serve (FCFS) scheduling, suffering from head-of-line blocking issues. To address the non-deterministic nature of LLMs and enable efficient interactive LLM serving, we present a speculative shortest-job-first (SSJF) scheduler that uses a light proxy model to predict LLM output sequence lengths. Our open-source SSJF implementation does not require changes to memory management or batching strategies. Evaluations on real-world datasets and production workload traces show that SSJF reduces average job completion times by 30.5-39.6% and increases throughput by 2.2-3.6x compared to FCFS schedulers, across no batching, dynamic batching, and continuous batching settings.
연구 동기 및 목표
- 자기회귀적 LLM 추론에서 변동하는 출력 시퀀스 길이로 인한 비결정적 실행 시간 문제를 해결하기 위해.
- 선착순 처리(FIFO) 스케줄링에 의존하는 LLM 서빙 시스템에서의 헤드-오브-라인 차단 문제를 줄이기 위해.
- 메모리 관리나 배치 전략을 변경하지 않고도 실시간 LLM 응용 프로그램에서 작업 완료 시간과 시스템 처리량을 향상시키기 위해.
- 배치 없음, 동적 배치, 지속적 배치 등 다양한 배치 설정에서 효율적인 스케줄링을 가능하게 하기 위해.
- 실제 LLM 서빙 워크로드에서 경량 프록시 모델을 활용한 시퀀스 길이 예측의 실현 가능성과 성능 향상을 입증하기 위해.
제안 방법
- 입력 쿼리를 기반으로 LLM 추론 요청의 출력 시퀀스 길이를 예측하기 위해 미세조정된 소형 BERT-base 프록시 모델을 훈련한다.
- 예측된 시퀀스 길이를 바탕으로 총 실행 시간을 추정하고, 이로 인해 의사결정 최단작업 우선(SSJF) 스케줄링을 구현한다.
- SSJF 스케줄러는 예측된 실행 시간이 짧은 요청을 우선 처리함으로써 헤드-오브-라인 차단을 줄인다.
- 프록시 모델은 주요 LLM 추론 파이프라인과 별도로 작동하므로, 메모리나 키-밸류 캐시 관리에 대한 변경 사항이 필요 없다.
- 시스템은 다양한 배치 전략을 지원한다: 배치 없음, 동적 배치, 지속적(반복) 배치.
- 다양한 입력 분포에 대응하기 위해 실세계 LLM 대화 데이터(예: LMSYS-Chat-1M)를 기반으로 프록시 모델을 재훈련한다.

실험 결과
연구 질문
- RQ1경량 프록시 모델이 LLM 추론 요청의 출력 시퀀스 길이를 정확하게 예측할 수 있는가?
- RQ2예측된 시퀀스 길이를 활용해 의사결정 최단작업 우선(SSJF) 스케줄링을 구현할 경우, LLM 서빙에서 평균 작업 완료 시간이 감소하는가?
- RQ3SSJF는 배치 없음, 동적 배치, 지속적 배치를 포함한 다양한 배치 전략에서 어떻게 성능을 발휘하는가?
- RQ4기존 LLM 서빙 시스템의 메모리 관리나 배치 논리 구조를 수정하지 않고도 SSJF가 처리량을 향상시킬 수 있는가?
- RQ5프록시 모델 기반 예측 방식은 자가 프롬프팅이나 소규모 데이터셋에 대한 회귀 분석과 비교해 어떤 성능 향상을 보이는가?
주요 결과
- 모든 평가된 배치 설정에서 SSJF는 FCFS 스케줄링 대비 평균 작업 완료 시간을 30.5–39.6% 감소시켰다.
- SSJF를 사용할 경우 요청 유입률과 급격한 유입 변동성에 관계없이 처리량이 2.2–3.6배 증가했다.
- 실세계 LLM 대화 데이터에서 프록시 모델은 높은 예측 정확도를 달성했으며, 회귀 기반 예측이 다중 분류 기반 예측보다 우수했다.
- 이 방법은 메모리나 캐시 관리 변경 없이도 다양한 배치 전략(배치 없음, 동적 배치, 지속적 배치) 전반에서 효과적이었다.
- 자기 프롬프팅 LLM보다 프록시 모델 기반 접근 방식이 편향을 피하고 오버헤드를 줄여 더 우수한 성능을 보였다.
- 오픈소스로 공개된 SSJF 구현체는 실제 생산 워크로드 트레이스와 인기 오픈소스 LLM에서 일관된 성능 향상을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.