Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-model Machine Learning Inference Serving with GPU Spatial Partitioning

Seungbeom Choi, Sunho Lee|arXiv (Cornell University)|2021. 09. 01.
Parallel Computing and Optimization Techniques참고 문헌 32인용 수 9
한 줄 요약

이 논문은 공간적 GPU 자원 분할을 활용하여 고성능, SLO 준수 다중 모델 머신 러닝 추론을 가능하게 하는 GPU 인지 스케줄링 프레임워크인 gpu-let을 제안한다. 모델 프로파일링과 간섭 인지 스케줄링에 기반해 가상 GPU 단위(gpu-lets)를 동적으로 할당함으로써, 기준 방법 대비 평균 102.6% 향상된 처리량을 달성하면서 엄격한 지연 시간 경계를 유지한다.

ABSTRACT

As machine learning techniques are applied to a widening range of applications, high throughput machine learning (ML) inference servers have become critical for online service applications. Such ML inference servers pose two challenges: first, they must provide a bounded latency for each request to support consistent service-level objective (SLO), and second, they can serve multiple heterogeneous ML models in a system as certain tasks involve invocation of multiple models and consolidating multiple models can improve system utilization. To address the two requirements of ML inference servers, this paper proposes a new ML inference scheduling framework for multi-model ML inference servers. The paper first shows that with SLO constraints, current GPUs are not fully utilized for ML inference tasks. To maximize the resource efficiency of inference servers, a key mechanism proposed in this paper is to exploit hardware support for spatial partitioning of GPU resources. With the partitioning mechanism, a new abstraction layer of GPU resources is created with configurable GPU resources. The scheduler assigns requests to virtual GPUs, called gpu-lets, with the most effective amount of resources. The paper also investigates a remedy for potential interference effects when two ML tasks are running concurrently in a GPU. Our prototype implementation proves that spatial partitioning enhances throughput by 102.6% on average while satisfying SLOs.

연구 동기 및 목표

  • SLO 제약 조건에 따른 배치 크기로 인한 GPU 자원 낭비 문제를 해결하기 위해.
  • 다양한 유형의 ML 모델을 동시에 실행할 수 있도록 다중 GPU 환경에서 GPU 자원 활용도를 향상시키기 위해.
  • 예측 가능하고 저지연 추론을 가능하게 하는 효율적인 공간적 및 시간적 GPU 자원 분할을 위한 새로운 추상화인 gpu-let을 설계하기 위해.
  • 공유 GPU 파artition에서 동시 실행되는 ML 워크로드 간의 간섭을 모델링하고 완화하기 위해.
  • SLO 제약 조건 하에서 실제 동적 요청 워크로드 환경에서 제안된 스케줄러의 효과성을 평가하기 위해.

제안 방법

  • NVIDIA의 MPS 공간 분할 메커니즘을 활용해 가상 GPU 단위인 gpu-let을 생성함으로써 세밀한 GPU 자원 공유를 가능하게 한다.
  • 스케줄링 결정을 위한 각 ML 모델의 계산 요구 사항과 지연 특성을 프로파일링한다.
  • pre-Volta 및 Volta+ GPU에서 동시 커널 실행을 고려해 튜닝된 간섭 추정 모델을 적용하여 성능 저하를 예측한다.
  • 들어오는 요청 빈도에 따라 gpu-let 크기를 동적으로 조정하여 SLO 준수를 유지하고 처리량을 극대화한다.
  • 공간 분할(MPS를 통한 gpu-lets)과 시간적 배치를 조합한 하이브리드 스케줄링 전략을 사용하여 자원 활용도를 최적화한다.
  • PyTorch 기반 프로토타입을 구현하고 이상적인 완전 스케줄러 및 기준 방법과의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1엄격한 SLO 제약 조건 하에서 공간적 GPU 분할이 다중 모델 ML 추론 서버의 처리량을 크게 향상시킬 수 있는가?
  • RQ2공유 GPU 파artition에서 동시 실행되는 ML 워크로드 간의 간섭을 정확히 모델링하고 완화할 수 있는가?
  • RQ3실제 환경에서 gpu-let 기반 스케줄러가 이상적인 완전 스케줄러의 성능을 어느 정도 재현할 수 있는가?
  • RQ4동적으로 변화하는 요청 워크로드에 대해 gpu-let의 재구성 전략은 SLO를 유지하면서 어떻게 반응하는가?
  • RQ5동일한 GPU에 이질적인 ML 모델을 공유 배치할 경우 자원 효율성과 SLO 준수 간의 상호 교환 관계는 어떠한가?

주요 결과

  • 제안된 gpu-let 스케줄러는 SLO 제약 조건 하에서 기준 방법 대비 평균 102.6% 향상된 처리량을 달성한다.
  • 시스템은 동적 워크로드 변화에도 불구하고 요청의 0.14%만 지연 시간 경계를 위반하여 SLO 준수를 성공적으로 유지한다.
  • 이deal한 완전 스케줄러의 최대 처리량의 92.3%를 달성하며, 최악의 경우 87.7%까지 유지된다.
  • gpu-let 크기를 요청 도착 빈도 변화에 따라 동적으로 조정함으로써 SLO 위반을 줄이는 데 기여한다.
  • 간섭 추정 모델을 통해 복수의 모델이 분할된 GPU 자원에서 동시에 실행될 경우의 성능 저하를 정확히 예측할 수 있다.
  • 프로토타입은 공간 분할이 SLO 제약으로 인해 배치 크기가 제한되는 상황에서 특히 GPU 활용도를 크게 향상시킨다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.