Skip to main content
QUICK REVIEW

[논문 리뷰] POLCA: Power Oversubscription in LLM Cloud Providers

Pratyush Patel, Esha Choukse|arXiv (Cornell University)|2023. 08. 24.
Ferroelectric and Negative Capacitance Devices인용 수 5
한 줄 요약

POLCA는 LLM 추론 클러스터에서 전력 과다할당을 안정적이고 신뢰성 있게 처리하기 위한 강력한 프레임워크로, 단계 인식 주파수 스케일링과 이중 전력 임계값을 활용하여, 비표준적이고 느린 외부 경로 GPU 전력 제어 환경에서도 성능 손실을 최소화하면서 서버 밀도를 30% 향상시킵니다.

ABSTRACT

Recent innovation in large language models (LLMs), and their myriad use-cases have rapidly driven up the compute capacity demand for datacenter GPUs. Several cloud providers and other enterprises have made substantial plans of growth in their datacenters to support these new workloads. One of the key bottleneck resources in datacenters is power, and given the increasing model sizes of LLMs, they are becoming increasingly power intensive. In this paper, we show that there is a significant opportunity to oversubscribe power in LLM clusters. Power oversubscription improves the power efficiency of these datacenters, allowing more deployable servers per datacenter, and reduces the deployment time, since building new datacenters is slow. We extensively characterize the power consumption patterns of a variety of LLMs and their configurations. We identify the differences between the inference and training power consumption patterns. Based on our analysis of these LLMs, we claim that the average and peak power utilization in LLM clusters for inference should not be very high. Our deductions align with the data from production LLM clusters, revealing that inference workloads offer substantial headroom for power oversubscription. However, the stringent set of telemetry and controls that GPUs offer in a virtualized environment, makes it challenging to have a reliable and robust power oversubscription mechanism. We propose POLCA, our framework for power oversubscription that is robust, reliable, and readily deployable for GPU clusters. Using open-source models to replicate the power patterns observed in production, we simulate POLCA and demonstrate that we can deploy 30% more servers in the same GPU cluster for inference, with minimal performance loss

연구 동기 및 목표

  • 증가하는 대규모 언어 모델(LLM)에 대한 수요로 인해 데이터센터에서 발생하는 GPU 용량 부족 문제를 해결합니다.
  • 높은 서버 수준 전력 사용률에도 불구하고 LLM 추론 클러스터에서 활용되지 않은 전력 여유가 존재하는지 규명합니다.
  • 비표준적이고 느린 외부 경로 GPU 전력 관리 인터페이스가 존재하는 환경에서도 작동하는 확장성 있고 신뢰할 수 있는 전력 과다할당 메커니즘을 설계합니다.
  • 다중 테넌트 GPU 클러스터에서 서비스 수준 목표(SLO)를 위반하지 않으면서 안전한 전력 과다할당을 가능하게 합니다.
  • LLM 추론에 있어 전력 과다할당이 실현 가능하고 유용하며, 성능 영향을 최소화할 수 있음을 입증합니다.

제안 방법

  • 추론 및 훈련 단계에서 다양한 LLM의 전력 소비 패턴을 분석하여 프롬프트 단계와 토큰 단계의 특이한 행동을 규명합니다.
  • 시뮬레이션 기반 평가를 위해 실제 LLM 클러스터의 전력 패턴을 재현하기 위해 오픈소스 모델을 사용합니다.
  • 이중 임계값 전력 제어 메커니즘을 구현: 클러스터 수준 전력 사용량 기반 저우선순위 스케일링과 정점 사용률에서 작동하는 하드웨어 전력브레이크를 비상 안전장치로 설정합니다.
  • 단계 인식 주파수 스케일링 적용 — 계산 강도가 낮은 토큰 단계 동안 GPU 주파수를 낮춰 평균 전력 소비를 감소시킵니다.
  • 기존 클러스터 수준 전력 관리자와 POLCA를 통합하여 생산 환경에서 원활한 배포를 가능하게 합니다.
  • 느리고 표준화되지 않은 외부 경로 관리 인터페이스를 보완하기 위해 내부 경로 GPU 제어 인터페이스를 활용하여 반응성과 신뢰성을 확보합니다.

실험 결과

연구 질문

  • RQ1높은 서버 수준 전력 사용률에도 불구하고 LLM 추론 클러스터에서 얼마나 많은 전력 여유가 존재하는가?
  • RQ2GPU 주파수 스케일링과 전력 제한이 LLM 추론 워크로드의 피크 전력 소비를 얼마나 효과적으로 줄이는가?
  • RQ3비표준적이고 느린 외부 경로 전력 관리 인터페이스가 존재하는 GPU 클러스터에서 전력 과다할당을 안전하고 신뢰성 있게 구현할 수 있는가?
  • RQ4전력 스케일링이 LLM 추론 워크로드에 미치는 성능 영향은 무엇이며, 이를 어떻게 최소화할 수 있는가?
  • RQ5SLO 위반 없이 기존 클러스터에서 전력 과다할당을 통해 얼마나 많은 서버 용량을 증가시킬 수 있는가?

주요 결과

  • LLM 추론 클러스터는 할당된 전력의 최대 80%만 사용하며, 전력 과다할당을 위한 상당한 여유가 존재합니다.
  • 훈련 클러스터는 대규모 훈련 작업 동안 동기화된 피크 전력 소비로 인해 약 10%의 여유만 제공합니다.
  • 단계 인식 주파수 스케일링 — 계산 강도가 낮은 토큰 단계에서 GPU 주파수를 낮추는 것 — 은 평균 전력 소비를 크게 감소시킬 수 있습니다.
  • POLCA는 LLM 추론 워크로드에서 클러스터당 배치 가능한 서버 수를 최소한의 성능 저하로 30% 증가시킬 수 있습니다.
  • 이중 임계값 전력 제어 메커니즘은 안전성과 신뢰성을 보장하며, 하드웨어 전력브레이크가 최후의 수단으로 작동합니다.
  • 이 프레임워크는 변화하는 LLM 아키텍처에 강건하며, 유사한 전력 절감 효과를 얻기 위해 훈련 및 다중 모odal 워크로드로도 확장 가능합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.