[논문 리뷰] PanGu-Σ: Towards Trillion Parameter Language Model with Sparse Heterogeneous Computing
PanGu-Σ는 512개의 Ascend 910 AI 가속기로 3290억 토큰을 훈련시켜 1.085조 파라미터의 스퍼스 모듈러형 전문가(MoE) 언어 모델이다. 효율적인 전문가 라우팅을 위해 무작위 라우팅 전문가(RRE)를 도입하고, 전문가 계산과 스토리지 분리(ECSS)를 통해 훈련 처리량을 6.3배 향상시켰으며, 제로샷 중국어 NLP 작업과 파인튜닝 응용에서 이전 모델을 능가한다.
The scaling of large language models has greatly improved natural language understanding, generation, and reasoning. In this work, we develop a system that trained a trillion-parameter language model on a cluster of Ascend 910 AI processors and MindSpore framework, and present the language model with 1.085T parameters named PanGu-Σ. With parameter inherent from PanGu-α, we extend the dense Transformer model to sparse one with Random Routed Experts (RRE), and efficiently train the model over 329B tokens by using Expert Computation and Storage Separation(ECSS). This resulted in a 6.3x increase in training throughput through heterogeneous computing. Our experimental findings show that PanGu-Σ provides state-of-the-art performance in zero-shot learning of various Chinese NLP downstream tasks. Moreover, it demonstrates strong abilities when fine-tuned in application data of open-domain dialogue, question answering, machine translation and code generation.
연구 동기 및 목표
- 초거대 언어 모델을 1조 파라미터를 초월하도록 확장하면서도 높은 훈련 효율성과 시스템 처리량을 유지하기 위해.
- 스퍼스 MoE 모델에서 발생하는 불균형 워크로드와 높은 통신 지연 문제를 새로운 라우팅 메커니즘으로 해결하기 위해.
- 전문가 계산과 스토리지의 시스템 수준 분리를 통해 분산 훈련에서 호스트-디바이스 통신과 최적화기 오버헤드를 줄이기 위해.
- 특히 중국어 및 다중모달 응용에서 제로샷 및 파인튜닝 기반의 하류 NLP 작업에서 최신 기술 성능을 달성하기 위해.
- 제한된 하드웨어 자원을 가진 이종 컴퓨팅 환경에서도 효율적이고 확장 가능하며 비용 효율적인 1조 파라미터 모델 훈련을 가능하게 하기 위해.
제안 방법
- 무작위 라우팅 전문가(RRE)를 제안하며, 먼저 도메인/작업별로 전문가를 그룹화하고, 그룹 내에서 가중치 없는 게이팅 함수를 사용해 토큰을 무작위로 균일하게 전문가에 할당하는 이중 레벨 라우팅 메커니즘을 구현한다.
- 전문가 계산과 스토리지 분리(ECSS)를 도입하여 전문가 계산을 스토리지에서 분리함으로써 호스트-디바이스 및 디바이스-호스트 통신, 최적화기 계산 오버헤드를 줄인다.
- MindSpore 딥러닝 프레임워크 내에서 텐서, 파이프라인, 데이터 병렬화를 융합한 하이브리드 병렬 전략을 활용해 512개의 Ascend 910 가속기로 훈련을 확장한다.
- 3290억 토큰으로 40개 이상의 언어에서 훈련하며 기존의 밀도 모델인 PanGu-α의 파라미터를 재사용하고 파인튜닝을 통해 스퍼스 MoE 아키텍처로 확장한다.
- 모델 병렬화와 시스템 수준 최적화를 조합해 큰 모델 크기에도 불구하고 높은 훈련 처리량을 유지한다.
- 일반화 및 추론 능력을 평가하기 위해 SuperGLUE 및 중국어 NLP 벤치마크에서 제로샷 평가 프로토콜을 적용한다.
실험 결과
연구 질문
- RQ1제한된 512개의 Ascend 910 가속기 클러스터에서 고처리량과 낮은 통신 오버헤드를 확보하면서도 1조 파라미터 스퍼스 MoE 모델을 효율적으로 훈련시킬 수 있는가?
- RQ2학습 효율성과 모델 성능 측면에서 기존의 가중치 있는 게이팅을 사용하는 MoE와 비교해 무작위 라우팅 전문가(RRE) 메커니즘은 어떻게 성능을 내는가?
- RQ3전문가 계산과 스토리지 분리(ECSS)는 호스트-디바이스 통신과 최적화 업데이트와 같은 시스템 수준의 병목 현상을 어느 정도 감소시키는가?
- RQ4PanGu-Σ의 제로샷 및 피셔샷 성능은 다양한 NLP 작업, 특히 자원이 부족하거나 샘플 수가 적은 설정에서 어떻게 나타나는가?
- RQ5밀도 기반 모델에서 파라미터 공유를 통해 확장된 스퍼스 MoE 모델이 대화, 번역, 코드 생성과 같은 다양한 하류 작업에서 최신 기술 성능을 달성할 수 있는가?
주요 결과
- PanGu-Σ는 512개의 Ascend 910 가속기에서 초당 69,905개 토큰의 훈련 처리량을 달성했으며, 동일한 초모수를 가진 MoE 모델 대비 6.3배 향상된 성능을 보였다.
- 모델은 중국어 NLP 벤치마크에서 제로샷 성능이 최신 기술 수준을 달성했으며, 텍스트 분류 및 질의응답과 같은 여러 작업에서 이전 최신 기술 모델을 능가했다.
- 380억 파라미터의 영문 서브모델은 제로샷 설정에서 SuperGLUE 평균 점수 64.62를 기록했으며, 이는 사용한 영문 토큰 수가 1120억에 불과한 상황에서 GPT-3 13B 모델의 평균 57.2점과 매우 유사한 성능을 보였다.
- 파인튜닝된 PanGu-Σ 응용은 개방형 대화, 기계 번역, 질의응답, 코드 생성 분야에서 뛰어난 성능을 보이며 강력한 전이 능력을 입증했다.
- RRE 메커니즘은 대화나 코드 생성과 같은 특수 작업을 위한 서브모델 추출을 효과적으로 가능하게 하여 재학습 없이도 모델의 적응성을 향상시켰다.
- ECSS는 호스트-디바이스 통신과 최적화기 계산 오버헤드를 크게 감소시켜 6.3배의 처리량 향상에 기여했으며, 제한된 하드웨어 클러스터에서의 효율적 훈련을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.