[논문 리뷰] Quiver: Supporting GPUs for Low-Latency, High-Throughput GNN Serving with Workload Awareness
Quiver는 작업 특성에 따라 적응하는 GPU 가속 GNN 서빙 시스템으로, 예측 메트릭을 사용해 동적으로 그래프 샘플링과 특성 집계를 스케줄링한다. 샘플링을 위한 확률적 샘플링 그래프 크기(PSGS), 배치를 위한 특성 액세스 확률을 활용하여, 최신 기술인 DGL 및 PyG에 비해 최대 35배 낮은 지연과 8배 높은 처리량을 달성한다.
Systems for serving inference requests on graph neural networks (GNN) must combine low latency with high throughout, but they face irregular computation due to skew in the number of sampled graph nodes and aggregated GNN features. This makes it challenging to exploit GPUs effectively: using GPUs to sample only a few graph nodes yields lower performance than CPU-based sampling; and aggregating many features exhibits high data movement costs between GPUs and CPUs. Therefore, current GNN serving systems use CPUs for graph sampling and feature aggregation, limiting throughput. We describe Quiver, a distributed GPU-based GNN serving system with low-latency and high-throughput. Quiver's key idea is to exploit workload metrics for predicting the irregular computation of GNN requests, and governing the use of GPUs for graph sampling and feature aggregation: (1) for graph sampling, Quiver calculates the probabilistic sampled graph size, a metric that predicts the degree of parallelism in graph sampling. Quiver uses this metric to assign sampling tasks to GPUs only when the performance gains surpass CPU-based sampling; and (2) for feature aggregation, Quiver relies on the feature access probability to decide which features to partition and replicate across a distributed GPU NUMA topology. We show that Quiver achieves up to 35 times lower latency with an 8 times higher throughput compared to state-of-the-art GNN approaches (DGL and PyG).
연구 동기 및 목표
- 비정규적인 계산을 겪는 GNN 서빙 문제를 해결한다. 이는 비균형적인 노드 차수로 인해 샘플링 및 집계 작업 부담이 변동하기 때문이다.
- GPU 성능이 예측 불가능하고 데이터 이동 비용이 높아 현재 시스템이 샘플링과 집계를 CPU에 의존하는 한계를 극복한다.
- 작업 특성에 따라 GPU 사용을 적응적으로 조정함으로써 저지연, 고처리량을 달성하는 GPU 기반 GNN 서빙 시스템을 설계한다.
- CPU-GPU 간 데이터 이동과 통신 병목 현상을 최소화함으로써, 높은 요청률(예: 10만+ 요청/초) 환경에서도 효율적이고 확장 가능한 GNN 추론을 가능하게 한다.
제안 방법
- 샘플링 작업의 계산 부하를 예측하고 GPU 대비 CPU 스케줄링을 안내하기 위해 런타임 메트릭으로 확률적 샘플링 그래프 크기(PSGS)를 도입한다.
- PSGS가 CPU 기반 샘플링 대비 성능 향상을 보일 경우에만 샘플링 작업을 GPU에 동적으로 할당하여, 작은 워크로드에서의 지연 증가를 방지한다.
- 특성 액세스 확률을 활용해 분산 GPU NUMA 아키텍처 상에서 데이터 배치 및 복제 전략을 안내하여, 교차 GPU 통신을 최소화한다.
- 일방향 메모리 액세스 및 GPU 바이패스를 활용해 특성 수집을 가속화함으로써 CPU 참여도를 낮추고 처리량을 향상시킨다.
- 작업 특성에 기반한 샘플링, 최적화된 특성 집계, DNN 추론을 분산 GPU 및 CPU 간에 통합한 스트리밍 파이프라인을 구현한다.
- NVLink와 InfiniBand을 활용해 GPU 간 및 서버 간 고대역폭, 저지연 데이터 이동을 구현함으로써 CPU 병목 현상을 피한다.
실험 결과
연구 질문
- RQ1왜곡된 그래프 구조로 인해 매우 비정규적인 워크로드가 발생하는 GNN 서빙 환경에서 GPU 활용도를 어떻게 최적화할 수 있는가?
- RQ2GPU 기반 샘플링이 CPU 기반 샘플링을 능가할 수 있는지를 예측할 수 있는 작업 특성 기반 메트릭은 무엇인가?
- RQ3분산 GPU 기반 GNN 시스템에서 통신 오버헤드를 최소화하기 위해 특성 배치 및 복제 전략은 어떻게 설계할 수 있는가?
- RQ4고처리량 GNN 서빙 환경에서 GPU 가속 특성 집계가 CPU 기반 통신 조정에 비해 어느 정도 뛰어난 성능을 발휘할 수 있는가?
- RQ5저수준 통신 최적화(예: NVLink, 일방향 읽기)가 종단 간 GNN 추론 지연과 처리량에 미치는 영향은 어떠한가?
주요 결과
- 동일한 30ms 지연 목표 하에서 Quiver는 최신 기술인 DGL 및 PyG에 비해 최대 35배 낮은 지연과 8배 높은 처리량을 달성한다.
- Reddit 데이터셋에서 Quiver는 2台 서버에서 4.9ms, 8대 서버에서 7.0ms의 서빙 지연을 기록했으며, DGL(8.5ms 및 12.2ms)과 AliGraph(6.7ms 및 9.7ms)를 모두 능가한다.
- Quiver의 특성 수집은 NVLink와 InfiniBand를 활용해 최대 40GB/s의 처리량을 달성했으며, DGL에서 사용하는 RPC 라이브러리(3GB/s)보다 13배 높다.
- InfiniBand 비활성화 시 mag240m에서 지연이 1.6배 증가했고, NVLink 비활성화 시 paper100m에서 지연이 1.5배 증가해 고속 인터커넥트의 핵심적 역할을 입증했다.
- Quiver의 작업 특성 기반 특성 배치 전략은 통신 오버헤드를 감소시키며, 서버 수가 2대에서 8대로 증가해도 낮은 지연을 유지한다.
- PSGS 기반 동적 스케줄링 덕분에 GPU 사용은 유익한 경우에만 활성화되어, 작은 워크로드나 낮은 복잡도 요청에서 성능 저하를 방지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.