Skip to main content
QUICK REVIEW

[논문 리뷰] Chimera: Efficiently Training Large-Scale Neural Networks with Bidirectional Pipelines

Shigang Li, Torsten Hoefler|arXiv (Cornell University)|2021. 07. 14.
Parallel Computing and Optimization Techniques참고 문헌 53인용 수 8
한 줄 요약

Chimera는 양방향 파이프라인 병렬화 기법을 제안하여 최신 기법 대비 최대 2.34배 높은 처리량을 달성하는 동기적 대규모 신경망 학습을 가능하게 한다. 여러 파이프라인을 통해 순방향 및 역방향 전파를 지능적으로 스케줄링함으로써 버블을 최대 50% 감소시키고 활성화 메모리 사용을 균형 있게 조절하여, 2,048개 GPU에서 정확도 손실을 최소화한 효율적인 학습을 가능하게 한다.

ABSTRACT

Training large deep learning models at scale is very challenging. This paper proposes Chimera, a novel pipeline parallelism scheme which combines bidirectional pipelines for efficiently training large-scale models. Chimera is a synchronous approach and therefore no loss of accuracy, which is more convergence-friendly than asynchronous approaches. Compared with the latest synchronous pipeline approach, Chimera reduces the number of bubbles by up to 50%; benefiting from the sophisticated scheduling of bidirectional pipelines, Chimera has a more balanced activation memory consumption. Evaluations are conducted on Transformer based language models. For a GPT-2 model with 1.3 billion parameters running on 2,048 GPU nodes of the Piz Daint supercomputer, Chimera improves the training throughput by 1.16x-2.34x over the state-of-the-art synchronous and asynchronous pipeline approaches.

연구 동기 및 목표

  • 대규모 딥러닝 학습을 위한 기존 파이프라인 병렬화 기법에서의 비효율성과 메모리 불균형 문제를 해결하기 위해.
  • 학습 수렴성과 정확도를 훼손하지 않으면서 파이프라인 버블을 줄이고 시스템 활용도를 향상시키기 위해.
  • 동기 학습 프레임워크 내에서 가속기 간 활성화 메모리 소비를 균형 있게 조절하기 위해.
  • GPT-2 및 BERT와 같은 대규모 모델을 분산 슈퍼컴퓨터에서 고처리량, 확장 가능한 학습을 가능하게 하기 위해.
  • 다양한 모델 및 시스템 아키텍처에 적응 가능한 유연하고 구성 가능한 파이프라인 스케줄링 전략을 제공하기 위해.

제안 방법

  • Chimera는 다수의 파이프라인 스테이지에서 동시에 순방향 및 역방향 전파를 수행하는 양방향 파이프라인을 활용하여 공백 시간과 버블을 감소시킨다.
  • 순방향 전파와 역방향 전파 간 워크로드 불균형을 관리하기 위해 새로운 스케줄링 전략(순방향 두배, 역방향 반으로 줄이기, 또는 직접 연결)을 사용한다.
  • 오래된 가중치를 방지함으로써 동기 학습을 유지하여 수렴 안정성과 정확도를 확보한다.
  • 파이프라인 스테이지 간 점대점 통신을 활용하고 최적화된 마이크로배치 및 파이프라인 깊이 설정을 통해 allreduce 오버헤드를 최소화한다.
  • 통신, 계산, 메모리 사용을 균형 있게 조절하기 위해 파이프라인 깊이(D)와 마이크로배치 크기(B)를 동적으로 구성한다.
  • 정확한 성능 모델을 활용하여 다양한 모델 및 하드웨어 환경에서 최적의 처리량을 달성하기 위한 시스템 설정을 안내한다.

실험 결과

연구 질문

  • RQ1대규모 딥러닝 학습에서 파이프라인 병렬화를 어떻게 최적화하여 버블을 줄이고 활용도를 향상시킬 수 있는가?
  • RQ2양방향 파이프라인이 단방향 파이프라인보다 높은 처리량을 달성하면서도 동기 학습과 수렴성을 유지할 수 있는가?
  • RQ3Chimera는 기존 파이프라인 기법 대비 가속기 간 활성화 메모리 소비를 어떻게 균형 있게 조절하는가?
  • RQ4다양한 스케줄링 전략(순방향 두배, 역방향 반으로 줄이기, 직접 연결)이 학습 효율성과 확장성에 미치는 영향은 무엇인가?
  • RQ5Chimera는 재계산 오버헤드를 최소화하면서 얼마나 큰 미니배치 크기와 깊은 모델로 확장될 수 있는가?

주요 결과

  • 2,048개 GPU 노드에서 Chimera는 13억 파라미터를 가진 GPT-2 모델에 대해 최신 동기 및 이방향 파이프라인 접근법 대비 처리량을 1.16배에서 2.34배 향상시켰다.
  • Chimera는 기존 동기 파이프라인 방법 대비 파이프라인 버블을 최대 50% 감소시켜 시스템 활용도를 크게 향상시켰다.
  • 직접 연결 스케줄링을 사용할 경우, 대규모 미니배치에서 GPipe, GEMS, DAPPLE 대비 각각 1.13배, 2.07배, 1.06배의 속도 향상을 달성했다.
  • 512개 GPU에서 GPT-2에 대해 순방향 두배 전략을 사용할 경우, PipeDream-2BW, GPipe, GEMS, DAPPLE 대비 각각 1.13배, 1.18배, 2.60배, 1.34배의 속도 향상을 기록했다.
  • D=32인 네 개의 파이프라인은 32층 GPT-2 모델에서 최고 성능을 발휘하지만, 일반적으로 두 개의 파이프라인에서 버블과 allreduce 오버헤드 간 최적의 트레이드오���을 이룩하여 가장 높은 처리량을 달성한다.
  • Chimera는 최신 기법과 동일한 최대 활성화 메모리 비용을 유지하면서도 가속기 간 메모리 소비를 더 균형 있게 조절한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.