[논문 리뷰] Chimera: Efficiently Training Large-Scale Neural Networks with Bidirectional Pipelines
Chimera는 양방향 파이프라인 병렬화 기법을 제안하여 최신 기법 대비 최대 2.34배 높은 처리량을 달성하는 동기적 대규모 신경망 학습을 가능하게 한다. 여러 파이프라인을 통해 순방향 및 역방향 전파를 지능적으로 스케줄링함으로써 버블을 최대 50% 감소시키고 활성화 메모리 사용을 균형 있게 조절하여, 2,048개 GPU에서 정확도 손실을 최소화한 효율적인 학습을 가능하게 한다.
Training large deep learning models at scale is very challenging. This paper proposes Chimera, a novel pipeline parallelism scheme which combines bidirectional pipelines for efficiently training large-scale models. Chimera is a synchronous approach and therefore no loss of accuracy, which is more convergence-friendly than asynchronous approaches. Compared with the latest synchronous pipeline approach, Chimera reduces the number of bubbles by up to 50%; benefiting from the sophisticated scheduling of bidirectional pipelines, Chimera has a more balanced activation memory consumption. Evaluations are conducted on Transformer based language models. For a GPT-2 model with 1.3 billion parameters running on 2,048 GPU nodes of the Piz Daint supercomputer, Chimera improves the training throughput by 1.16x-2.34x over the state-of-the-art synchronous and asynchronous pipeline approaches.
연구 동기 및 목표
- 대규모 딥러닝 학습을 위한 기존 파이프라인 병렬화 기법에서의 비효율성과 메모리 불균형 문제를 해결하기 위해.
- 학습 수렴성과 정확도를 훼손하지 않으면서 파이프라인 버블을 줄이고 시스템 활용도를 향상시키기 위해.
- 동기 학습 프레임워크 내에서 가속기 간 활성화 메모리 소비를 균형 있게 조절하기 위해.
- GPT-2 및 BERT와 같은 대규모 모델을 분산 슈퍼컴퓨터에서 고처리량, 확장 가능한 학습을 가능하게 하기 위해.
- 다양한 모델 및 시스템 아키텍처에 적응 가능한 유연하고 구성 가능한 파이프라인 스케줄링 전략을 제공하기 위해.
제안 방법
- Chimera는 다수의 파이프라인 스테이지에서 동시에 순방향 및 역방향 전파를 수행하는 양방향 파이프라인을 활용하여 공백 시간과 버블을 감소시킨다.
- 순방향 전파와 역방향 전파 간 워크로드 불균형을 관리하기 위해 새로운 스케줄링 전략(순방향 두배, 역방향 반으로 줄이기, 또는 직접 연결)을 사용한다.
- 오래된 가중치를 방지함으로써 동기 학습을 유지하여 수렴 안정성과 정확도를 확보한다.
- 파이프라인 스테이지 간 점대점 통신을 활용하고 최적화된 마이크로배치 및 파이프라인 깊이 설정을 통해 allreduce 오버헤드를 최소화한다.
- 통신, 계산, 메모리 사용을 균형 있게 조절하기 위해 파이프라인 깊이(D)와 마이크로배치 크기(B)를 동적으로 구성한다.
- 정확한 성능 모델을 활용하여 다양한 모델 및 하드웨어 환경에서 최적의 처리량을 달성하기 위한 시스템 설정을 안내한다.
실험 결과
연구 질문
- RQ1대규모 딥러닝 학습에서 파이프라인 병렬화를 어떻게 최적화하여 버블을 줄이고 활용도를 향상시킬 수 있는가?
- RQ2양방향 파이프라인이 단방향 파이프라인보다 높은 처리량을 달성하면서도 동기 학습과 수렴성을 유지할 수 있는가?
- RQ3Chimera는 기존 파이프라인 기법 대비 가속기 간 활성화 메모리 소비를 어떻게 균형 있게 조절하는가?
- RQ4다양한 스케줄링 전략(순방향 두배, 역방향 반으로 줄이기, 직접 연결)이 학습 효율성과 확장성에 미치는 영향은 무엇인가?
- RQ5Chimera는 재계산 오버헤드를 최소화하면서 얼마나 큰 미니배치 크기와 깊은 모델로 확장될 수 있는가?
주요 결과
- 2,048개 GPU 노드에서 Chimera는 13억 파라미터를 가진 GPT-2 모델에 대해 최신 동기 및 이방향 파이프라인 접근법 대비 처리량을 1.16배에서 2.34배 향상시켰다.
- Chimera는 기존 동기 파이프라인 방법 대비 파이프라인 버블을 최대 50% 감소시켜 시스템 활용도를 크게 향상시켰다.
- 직접 연결 스케줄링을 사용할 경우, 대규모 미니배치에서 GPipe, GEMS, DAPPLE 대비 각각 1.13배, 2.07배, 1.06배의 속도 향상을 달성했다.
- 512개 GPU에서 GPT-2에 대해 순방향 두배 전략을 사용할 경우, PipeDream-2BW, GPipe, GEMS, DAPPLE 대비 각각 1.13배, 1.18배, 2.60배, 1.34배의 속도 향상을 기록했다.
- D=32인 네 개의 파이프라인은 32층 GPT-2 모델에서 최고 성능을 발휘하지만, 일반적으로 두 개의 파이프라인에서 버블과 allreduce 오버헤드 간 최적의 트레이드오���을 이룩하여 가장 높은 처리량을 달성한다.
- Chimera는 최신 기법과 동일한 최대 활성화 메모리 비용을 유지하면서도 가속기 간 메모리 소비를 더 균형 있게 조절한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.