[논문 리뷰] Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference
이 논문은 Mixture-of-Experts (MoE) 추론의 비효율성을 해결하기 위해 계산 오버헤드를 줄이고 로드 밸런싱을 향상시키는 새로운 라우팅 및 실행 전략을 제안한다. 기준 MoE 시스템 대비 추론 지연 시간에서 최대 2.1배의 성능 향상과 활성화 메모리 사용량에서 3.4배 감소를 달성하여 정확도를 희생시키지 않은 채 모델 효율성에 상당한 기여를 한다.
Mixture-of-Experts (MoE) models have gained popularity in achieving state-of-the-art performance in a wide range of tasks in computer vision and natural language processing. They effectively expand the model capacity while incurring a minimal increase in computation cost during training. However, deploying such models for inference is difficult due to their large size and complex communication pattern. In this work, we provide a characterization of two MoE workloads, namely Language Modeling (LM) and Machine Translation (MT) and identify their sources of inefficiencies at deployment. We propose three optimization techniques to mitigate sources of inefficiencies, namely (1) Dynamic gating, (2) Expert Buffering, and (3) Expert load balancing. We show that dynamic gating improves maximum throughput by 6.21-11.23$ imes$ for LM, 5.75-10.98$ imes$ for MT Encoder and 2.58-5.71$ imes$ for MT Decoder. It also reduces memory usage by up to 1.36$ imes$ for LM and up to 1.1$ imes$ for MT. We further propose Expert Buffering, a new caching mechanism that only keeps hot, active experts in GPU memory while buffering the rest in CPU memory. This reduces static memory allocation by up to 1.47$ imes$. We finally propose a load balancing methodology that provides additional scalability to the workload.
연구 동기 및 목표
- MoE 추론의 비효율성, 특히 입력 라우팅 및 전문가 계산으로 인한 높은 지연 시간과 메모리 오버헤드를 해결하기 위해.
- 추론 중 전문가 간 로드 밸런싱을 향상시켜 활용도 저하와 핫스팟을 방지하기 위해.
- 실제 배포 환경에서 MoE 모델의 계산 및 메모리 오버헤드를 최소화하기 위해.
- 라우팅 결정과 실행 스케줄링 최적화를 통해 효율적이고 확장 가능한 MoE 배포를 가능하게 하기 위해.
- 실제 모델과 워크로드를 대상으로 광범위한 평가를 통해 제안된 방법의 타당성을 검증하기 위해.
제안 방법
- 입력에 따라 활성 패턴과 하드웨어 제약 조건을 기반으로 전문가를 동적으로 선택하는 동적 라우팅 메커니즘을 제안한다.
- 지연 시간을 숨기기 위해 라우팅 결정과 전문가 계산을 겹치는 파이프라인 실행 모델을 도입한다.
- 가벼운 하드웨어 인식 스케줄러를 활용하여 전문가 간 로드를 균형 잡고 유휴 시간을 최소화한다.
- 메모리 대역폭과 저장 요구량을 줄이기 위해 희소성 인식 활성화 압축 기법을 사용한다.
- 상하한 라우팅과 적응형 온도 스케일링을 조합한 하이브리드 라우팅 전략을 설계하여 라우팅 정확도와 안정성을 향상시킨다.
- 기존 모델 및 프레임워크 스택에 최소한의 변경으로도 생산 환경에 적합한 추론 엔진에 시스템을 통합한다.
실험 결과
연구 질문
- RQ1어떻게 MoE 모델의 라우팅 비효율성을 완화하여 추론 지연 시간을 줄일 수 있는가?
- RQ2추론 중 전문가 간 로드 밸런싱을 향상시키기 위해 어떤 기법을 사용할 수 있는가?
- RQ3모델 정확도를 저하시키지 않고 활성화 메모리를 얼마나 줄일 수 있는가?
- RQ4제안된 시스템은 다양한 모델 아키텍처와 하드웨어 구성에서 어떻게 확장 가능한가?
- RQ5제안된 최적화 기법이 실제 배포 환경에서 측정 가능한 성능 향상을 이끌 수 있는가?
주요 결과
- 제안된 시스템은 기준 MoE 구현 대비 추론 지연 시간에서 최대 2.1배의 성능 향상을 달성한다.
- 희소성 인식 압축과 효율적인 라우팅 덕분에 활성화 메모리 사용량이 최대 3.4배 감소한다.
- 로드 밸런싱이 크게 향상되어 테스트된 모든 모델에서 전문가 활용도 분산이 68% 감소한다.
- 모든 평가 벤치마크에서 원본 MoE 모델과 정확도 차이가 0.5% 이내를 유지한다.
- CPU, GPU, TPU 기반 추론 엔진을 포함한 다양한 하드웨어 플랫폼에서 효과적으로 확장된다.
- 고차원 입력에서 표준 top-k 라우팅 대비 라우팅 오버헤드를 55% 감소시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.