Skip to main content
QUICK REVIEW

[논문 리뷰] DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale

Reza Yazdani Aminabadi, Samyam Rajbhandari|arXiv (Cornell University)|2022. 06. 30.
Advanced Neural Network Applications인용 수 8
한 줄 요약

DeepSpeed Inference는 다양한 하드웨어에서 대규모 밀도형 및 희소형(Mixture-of-Experts) 트랜스포머 모델의 효율적이고 확장 가능한 추론을 위한 통합 시스템을 제공한다. 다중 GPU 최적화, ZeRO-Inference를 통한 CPU/NVMe 오프로딩, 전용 커널을 조합함으로써 기존 최고 수준(SOTA) 대비 최대 7.3배 높은 지연 시간과 1.5배 높은 처리량을 달성하여 수백 개의 GPU에서 실시간 지연 시간을 갖는 트리리언 파ram터 모델을 가능하게 한다.

ABSTRACT

The past several years have witnessed the success of transformer-based models, and their scale and application scenarios continue to grow aggressively. The current landscape of transformer models is increasingly diverse: the model size varies drastically with the largest being of hundred-billion parameters; the model characteristics differ due to the sparsity introduced by the Mixture-of-Experts; the target application scenarios can be latency-critical or throughput-oriented; the deployment hardware could be single- or multi-GPU systems with different types of memory and storage, etc. With such increasing diversity and the fast-evolving pace of transformer models, designing a highly performant and efficient inference system is extremely challenging. In this paper, we present DeepSpeed Inference, a comprehensive system solution for transformer model inference to address the above-mentioned challenges. DeepSpeed Inference consists of (1) a multi-GPU inference solution to minimize latency while maximizing the throughput of both dense and sparse transformer models when they fit in aggregate GPU memory, and (2) a heterogeneous inference solution that leverages CPU and NVMe memory in addition to the GPU memory and compute to enable high inference throughput with large models which do not fit in aggregate GPU memory. DeepSpeed Inference reduces latency by up to 7.3X over the state-of-the-art for latency-oriented scenarios and increases throughput by over 1.5x for throughput-oriented scenarios. Moreover, it enables trillion parameter scale inference under real-time latency constraints by leveraging hundreds of GPUs, an unprecedented scale for inference. It can inference 25x larger models than with GPU-only solutions, while delivering a high throughput of 84 TFLOPS (over $50\%$ of A6000 peak).

연구 동기 및 목표

  • 다양한 메모리 및 지연 시간 제약 조건을 가진 이질적 하드웨어에서 밀도형에서 MoE 아키텍처에 이르기까지 확장성 있는 트랜스포머 모델을 배포하는 데 증가하는 도전 과제를 해결한다.
  • 작은 배치, 지연 시간에 민감한 워크로드에 대해 최적화되지 않은 기존 추론 시스템의 한계를 극복하고, GPU 메모리 용량을 초월해 효율적으로 확장하지 못하는 문제를 해결한다.
  • GPU 메모리에 들어가지 않는 모델에 대해 CPU와 NVMe 스토리지 메모리 계층을 확장하여 고처리량, 저지연 추론을 가능하게 한다.
  • 다중 GPU 및 이질적 시스템에서 적응형 스케줄링, 커널 최적화 및 메모리 관리 기반으로 지연 시간에 민감한 워크로드와 처리량 중심 워크로드를 모두 지원한다.

제안 방법

  • ZeRO-Inference를 도입하여 모델 가중치를 CPU 또는 NVMe 스토리지로 이동시키면서 활성화 값은 GPU 메모리에 유지함으로써 GPU 메모리 용량을 초월한 모델 추론을 가능하게 한다.
  • DeepFusion을 활용해 여러 연산자(예: 선형, 레이어노멀라이제이션, 소프트맥스)를 단일 커널으로 결합함으로써 커널 실행 및 데이터 이동 오버헤드를 줄여 작은 배치 크기에서 지연 시간을 개선한다.
  • 지연 시간이 메모리 대역폭에 의해 제한되는 작은 배치 추론 워크로드에서 메모리 대역폭 활용도를 극대화하기 위해 GeMM 커널을 추론 워크로드에 최적화한다.
  • 파이프라인 및 텐서 병렬화를 조합한 하이브리드 스케줄링을 적용하여 동적 로드 밸런싱을 통해 모든 장치가 항상 바쁜 상태를 유지하며, 특히 이전 토큰에 의존하는 자동재귀적 생성에서 중요하다.
  • 모든 장치 간 통신 최적화 및 전문가 병렬화를 활용해 수백 개의 GPU에서 희소 MoE 모델을 효율적으로 확장하며 높은 메모리 대역폭 확장성을 달성한다.
  • 여러 GPU 간 PCIe 대역폭 집계를 통해 근사 선형 처리량 확장을 달성하여, 거대한 모델에서도 고처리량 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다양한 모델 크기와 희소성에 따라 변하는 대규모 트랜스포머 모델에 대해 지연 시간에 민감한 워크로드와 처리량 중심 워크로드를 동시에 효율적으로 지원할 수 있는 추론 시스템 설계는 어떻게 해야 하는가?
  • RQ2소규모 배치 크기에서 지연 시간이 메모리 대역폭에 의해 제한되는 상황에서 높은 메모리 대역폭 활용도와 낮은 커널 실행 오버헤드를 달성하기 위해 필요한 시스템 수준 최적화는 무엇인가?
  • RQ3처리량을 저하시키거나 수용할 수 없는 지연 시간을 유발하지 않으면서 모델 가중치를 CPU 및 NVMe 스토리지로 효과적으로 오프로딩할 수 있는 방법은 무엇인가?
  • RQ4이전 토큰에 의존하는 자동재귀적 생성 워크로드에서 고도로 활용된 장치를 유지하기 위해 필요한 병렬 처리 전략과 스케줄링 기법은 무엇인가?
  • RQ5이종 메모리(GPU, CPU, NVMe)와 혼합 정밀도 계산을 사용할 때, 수백 개의 GPU에 걸쳐 추론 성능이 얼마나 확장될 수 있는가?

주요 결과

  • DeepSpeed Inference는 기존 최고 수준(SOTA) 대비 지연 시간을 최대 7.3배 감소시켜, 주로 커널 융합 및 최적화된 메모리 액세스 덕분이다.
  • ZeRO-Inference의 CPU/NVMe 오프로딩 덕분에 GPU 메모리에 들어가는 모델이라도 크게 증가된 배치 크기를 허용함으로써 처리량을 1.5배 이상 향상시킨다.
  • 수백 개의 GPU를 사용해 실시간 지연 시간 제약 조건 하에서 트리리언 파라미터 모델 추론을 지원하며, 84 TFLOPS(6000 A6000 최고 성능의 50% 이상)의 처리량을 달성한다.
  • CPU 메모리에 들어가는 모델의 경우, ZeRO-Inference는 CPU 전용 추론 대비 25배 이상 높은 처리량을 제공하여 하이브리드 메모리 오프로딩의 효과를 입증한다.
  • 8× A100 노드 환경에서 하이브리드 스케줄링은 FasterTransformer 대비 프ompt 처리 지연 시간을 PP+MP 기준 1.18배, MP 전용 기준 3.06배 감소시켜 자동재귀적 추론 속도 향상의 강력한 성과를 보였다.
  • 희소 MoE 모델에서 DeepSpeed Inference는 메모리 대역폭 확장성에서 PyTorch 기준 대비 뛰어난 성능을 보이며, 최적화된 all-to-all 및 MoE 커널 덕분에 128개 GPU까지도 높은 대역폭 유지가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.