Skip to main content
QUICK REVIEW

[논문 리뷰] E-Sparse: Boosting the Large Language Model Inference through Entropy-based N:M Sparsity

Yunwei Li, Lin Niu|arXiv (Cornell University)|2023. 10. 24.
Topic Modeling인용 수 4
한 줄 요약

E-Sparse는 대규모 언어 모델(Large Language Models, LLMs)을 위한 일회성, 엔트로피 기반 N:M 희소성 방법을 제안한다. 이 방법은 은닉 상태 특징의 정보 엔트로피를 이용해 채널 수준의 희소성 제거를 이끌며, 전역 및 국소 채널 셔플링을 통해 모델 정확도를 유지한다. 이는 LLaMA 및 OPT 모델에서 최대 1.53배 빠른 추론과 43.52%의 메모리 절감을 달성하며, 최소한의 정확도 손실로 NVIDIA Ampere GPU를 활용한 FasterTransformer 내 커스텀 Sparse-GEMM 구현을 통해 실현된다.

ABSTRACT

Traditional pruning methods are known to be challenging to work in Large Language Models (LLMs) for Generative AI because of their unaffordable training process and large computational demands. For the first time, we introduce the information entropy of hidden state features into a pruning metric design, namely E-Sparse, to improve the accuracy of N:M sparsity on LLM. E-Sparse employs the information richness to leverage the channel importance, and further incorporates several novel techniques to put it into effect: (1) it introduces information entropy to enhance the significance of parameter weights and input feature norms as a novel pruning metric, and performs N:M sparsity without modifying the remaining weights. (2) it designs global naive shuffle and local block shuffle to quickly optimize the information distribution and adequately cope with the impact of N:M sparsity on LLMs' accuracy. E-Sparse is implemented as a Sparse-GEMM on FasterTransformer and runs on NVIDIA Ampere GPUs. Extensive experiments on the LLaMA family and OPT models show that E-Sparse can significantly speed up the model inference over the dense model (up to 1.53X) and obtain significant memory saving (up to 43.52%), with acceptable accuracy loss.

연구 동기 및 목표

  • 실제 생성형 AI 애플리케이션에서 대규모 언어 모델(LLMs)을 구동할 때 발생하는 높은 계산 및 메모리 비용을 해결하기 위해.
  • 기존의 희소화 방법이 자주 요구하는 고비용 재학습과 하드웨어 최적화된 희소 패턴을 활용하지 못하는 한계를 극복하기 위해.
  • 재학습 없이도 효율적인 N:M 희소성을 실현하는 후기 훈련, 일회성 희소화 방법을 설계하여 현대 GPU에서 빠른 배포에 적합하게 만들기 위해.
  • 은닉 상태 특징의 정보 엔트로피를 새로운 채널 중요도 측정 지표로 도입하여, 은닉 상태 특징의 정보 러프니스를 보다 정확히 측정하고 핵심 파라미터 유지에 기여하기 위해.
  • 희소화 과정에서 채널 간 정보 집중 현상으로 인한 정확도 저하 문제를 완화하기 위해 채널 셔플링 전략을 도입하기 위해.

제안 방법

  • 은닉 상태 특징의 정보 엔트로피와 입력 특징 노름, 파라미터 크기를 조합한 새로운 희소화 메트릭을 도입하여 채널 중요도를 평가한다.
  • 정보 엔트로피를 활용해 은닉 상태 각 채널 내 정보 러프니스를 정량화하여, 유지해야 할 핵심 파라미터를 더 정확히 식별한다.
  • 전역 난수 셔플링과 국소 블록 셔플링을 적용하여 채널 간 정보 분포를 재분배함으로써 정보 집중 현상을 감소시키고, N:M 희소화 후 성능 유지를 도모한다.
  • FasterTransformer 내 N:M 희소성에 최적화된 커스텀 Sparse-GEMM 커널을 구현하여, NVIDIA Ampere GPU의 Sparse Tensor Core 가속 기능을 네이티브로 지원한다.
  • 재학습이나 가중치 갱신 없이 일회성 희소화를 수행하며, 엔트로피 기반 메트릭과 셔플링 기법에 의존해 정확도를 유지한다.
  • 최소한의 오버헤드로 추론 파이프라인에 통합하여 표준 LLM 추론 워크로드 환경에서 효율적인 배포를 가능하게 한다.

실험 결과

연구 질문

  • RQ1은닉 상태 특징의 정보 엔트로피가 크기나 노름만을 사용하는 것보다 LLMs의 N:M 희소화를 이끄는 데 더 효과적인 메트릭이 될 수 있는가?
  • RQ2채널 간 정보 집중 현상이 LLMs의 N:M 구조적 희소화 정확도에 미치는 영향은 어떠한가?
  • RQ3전역 및 국소 셔플링 기법이 LLMs의 구조적 희소화로 인한 정확도 저하를 효과적으로 완화할 수 있는가?
  • RQ4엔트로피 기반 N:M 희소화가 재학습 없이 추론 속도를 얼마나 가속화하고 메모리 사용을 얼마나 줄일 수 있는가?
  • RQ5기존의 Wanda나 SparseGPT와 같은 후기 훈련 희소화 방법과 비교해 본다면, 제안된 방법은 속도, 메모리 사용, 정확도 측면에서 어떤가?

주요 결과

  • E-Sparse는 LLaMA 및 OPT 모델에서 FP16 기반 밀도 모델 대비 최대 1.53배의 빠른 추론 속도를 달성했으며, 컨텍스트 및 디코더 단계 모두에서 일관된 속도 향상을 보였다.
  • LLaMA 모델에서는 최대 43.52%의 메모리 사용 감소를 기록했으며, 모델 크기가 클수록 비례적으로 더 큰 메모리 절감 효과를 보였다.
  • LLaMA 모델에서 최신 기술 대비 퍼플렉서티를 1.32 포인트 향상시켜, 강력한 희소화에도 불구하고 정확도 유지 능력이 뛰어나다는 것을 입증했다.
  • 엔트로피 기반 희소화와 채널 셔플링의 조합은 정보가 풍부한 채널을 유지함으로써 정확도 손실을 줄였다.
  • FasterTransformer 내 커스텀 Sparse-GEMM 커널은 NVIDIA Ampere GPU에서 효율적인 추론을 가능하게 하였으며, A100 하드웨어에서 최대 34.8%의 지연 감소를 기록했다.
  • 다양한 모델 크기와 시퀀스 길이에서도 뛰어난 성능 유지를 보이며, 실제 배포 환경에서의 강건성과 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.