[논문 리뷰] PRETZEL: Opening the Black Box of Machine Learning Prediction Serving Systems
Pretzel는 모델 파이프라인 내부를 노출시켜 엔드 투 엔드 및 다중 파이프라인 실행을 최적화하는 화이트박스 기계학습 예측 서빙 시스템을 소개한다. 이를 통해 공유 파rameter, 물리적 연산자 재사용, 지능적인 스케줄링이 가능해지며, 최신의 블랙박스 시스템 대비 25배 낮은 메모리 사용량, 5.5배 낮은 99퍼센트 백분위수 지연, 4.7배 높은 처리량을 달성한다.
Machine Learning models are often composed of pipelines of transformations. While this design allows to efficiently execute single model components at training time, prediction serving has different requirements such as low latency, high throughput and graceful performance degradation under heavy load. Current prediction serving systems consider models as black boxes, whereby prediction-time-specific optimizations are ignored in favor of ease of deployment. In this paper, we present PRETZEL, a prediction serving system introducing a novel white box architecture enabling both end-to-end and multi-model optimizations. Using production-like model pipelines, our experiments show that PRETZEL is able to introduce performance improvements over different dimensions; compared to state-of-the-art approaches PRETZEL is on average able to reduce 99th percentile latency by 5.5x while reducing memory footprint by 25x, and increasing throughput by 4.7x.
연구 동기 및 목표
- 배포 용이성을 위해 예측 시점 최적화를 무시하는 블랙박스 기계학습 서빙 시스템의 한계를 해결하기 위해.
- 엔드 투 엔드 및 다중 파이프라인 최적화를 통해 기계학습 추론에서 메모리 사용량과 지연을 줄이기 위해.
- 유사한 파이프라인 간 공유 파arameter 및 물리적 연산자로 자원 활용도와 처리량을 향상시키기 위해.
- 공유 CPU 및 메모리 자원에 추론 요청을 효율적으로 바인딩하는 스케줄링 시스템을 설계하기 위해.
- 실세계 배포 환경에서 생산용 기계학습 파이프라인에 대해 고성능, 저지연 추론을 가능하게 하기 위해.
제안 방법
- Pretzel는 오프라인 단계(통계 수집 및 모델 계획 컴파일)와 온라인 단계(요청 실행)로 구성된 두 단계 아키텍처를 사용한다.
- 학습된 파이프라인을 화이트박스 모델 계획으로 컴파일하여 최적화를 위한 논리적 및 물리적 연산자 구조를 노출시킨다.
- 학습 기간 통계와 메모리 기반 데이터 시스템 원칙을 활용해 자원 사용량을 최소화하는 엔드 투 엔드 최적화를 적용한다.
- 다중 파이프라인 최적화를 통해 유사한 파이프라인 간 공유 파arameter(예: 가중치, 사전) 및 물리적 연산자를 가능하게 한다.
- 새로운 이벤트 기반 스케줄러가 공유 CPU 실행 단위에 추론 요청을 바인딩하여 동시 실행과 부하 인식 자원 풀링을 가능하게 한다.
- 데이터베이스 기반 쿼리 최적화 기법, 즉 논리적 및 물리적 계획 재작성 기법을 활용해 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1기계학습 예측 서빙 시스템은 배포 용이성을 희생시키지 않고도 지연과 메모리 사용량을 어떻게 줄일 수 있는가?
- RQ2파이프라인 간 공유 파arameter 및 물리적 연산자가 추론 워크로드에서 자원 활용도를 얼마나 향상시킬 수 있는가?
- RQ3실제 생산 환경에서 엔드 투 엔드 및 다중 파이프라인 최적화가 블랙박스 서빙 시스템을 초월할 수 있는가?
- RQ4화이트박스 아키텍처는 블랙박스 컨테이너 기반 접근 방식에 비해 기계학습 추론에서 더 나은 스케줄링과 동시성을 어떻게 가능하게 하는가?
- RQ5공유 자원 환경에서 기계학습 파이프라인의 컴파일러 수준 최적화를 통해 달성 가능한 성능 향상은 어느 정도인가?
주요 결과
- Pretzel는 최신의 블랙박스 시스템인 Clipper 및 TensorFlow Serving에 비해 99퍼센트 백분위수 지연을 5.5배 감소시켰다.
- 유사한 파이프라인 간 파arameter 및 물리적 연산자 공유로 인해 메모리 사용량이 25배 감소했다.
- 효율적인 자원 풀링과 동시 요청 스케줄링 덕분에 처리량이 4.7배 증가했다.
- 모든 핵심 메트릭에서 ML.Net 및 Clipper를 초월했으며, 500개의 생산용 파이프라인에서 일관된 성능 향상을 입증했다.
- 화이트박스 아키텍처는 파이프라인 내부를 노출시켜 공동 최적화를 가능하게 하여 상당한 성능 향상을 이끌어냈다.
- 공유 구성 요소를 가진 모델의 공재배치는 尾지연을 감소시키고 스왑으로 인한 메모리 압박을 방지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.