[논문 리뷰] Whale: Efficient Giant Model Training over Heterogeneous GPUs
Whale은 혼합 병렬 전략의 통합 표현을 위한 두 가지 모델 주석 원칙을 도입함으로써 이질적인 GPU 간에 트리리언 파rameter 모델을 효율적이고 확장 가능하게 훈련할 수 있는 고수준 딥러닝 프레임워크이다. 이는 분산 그래프 최적화와 하드웨어 인지적 로드 밸런싱을 자동화하여, 최소한의 코드 변경과 높은 효율성으로 512개의 V100 GPU에서 10조 파라미터 훈련을 달성한다.
The scaling up of deep neural networks has been demonstrated to be effective in improving model quality, but also encompasses several training challenges in terms of training efficiency, programmability, and resource adaptability. We present Whale, a general and efficient distributed training framework for giant models. To support various parallel strategies and their hybrids, Whale generalizes the programming interface by defining two new primitives in the form of model annotations, allowing for incorporating user hints. The Whale runtime utilizes those annotations and performs graph optimizations to transform a local deep learning DAG graph for distributed multi-GPU execution. Whale further introduces a novel hardware-aware parallel strategy, which improves the performance of model training on heterogeneous GPUs in a balanced manner. Deployed in a production cluster with 512 GPUs, Whale successfully trains an industry-scale multimodal model with over ten trillion model parameters, named M6, demonstrating great scalability and efficiency.
연구 동기 및 목표
- 이질적인 GPU 클러스터에서 수조 개의 파라미터를 가진 거대한 딥러닝 모델을 훈련하는 데 발생하는 과제를 해결하기 위해.
- 데이터 병렬, 모델 병렬, 파이프라인 병렬과 같은 복잡한 병렬 전략을 수동으로 관리하는 데 소요되는 사용자 노고를 줄이기 위해.
- 런타임 인지 최적화를 통해 모델 개발과 이질적인 하드웨어 환경 사이의 격차를 메우기 위해.
- 코드 변경 없이 1000억에서 1조 파라미터로의 스케일링을 원활하게 가능하게 하기 위해.
- 자동화된 그래프 리라이팅을 통해 최소한의 성능 오버헤드로 하이브리드 병렬 전략을 지원하기 위해.
제안 방법
- 모든 병렬 전략과 그 하이브리드 형태를 표현하기 위해 모델 주석을 통한 두 가지 고수준 원칙을 도입하여 프로그래밍을 저수준 분산 로직에서 분리한다.
- 이 주석을 활용해 자동 그래프 최적화를 수행하여 국소 계산 그래프를 효율적인 분산 실행 계획으로 변환한다.
- 계산 및 메모리 용량을 기반으로 모델 파artitions를 GPU에 매핑하는 하드웨어 인지적 로드 밸런싱 알고리즘을 적용하여 자원 활용도를 향상시킨다.
- 다양한 능력을 가진 여러 GPU에서의 효율적 실행을 위해 그래프 치환과 패턴 매칭을 적용하여 계산 그래프를 재작성한다.
- TensorFlow와 통합되어 텐서 및 파이프라인 병렬화를 포함한 모델 컴포onent의 자동 분산을 지원하며, 수동 장치 배치 없이도 가능하다.
- 텐서 오프로딩 및 메모리 최적화 기법을 활용하여 GPU 메모리 한계를 초월해 1조 파라미터 훈련을 가능하게 한다.
실험 결과
연구 질문
- RQ1딥러닝 프레임워크는 어떻게 최소한의 사용자 노력으로 데이터 병렬, 모델 병렬, 파이프라인 병렬과 같은 혼합 병렬 전략을 효율적으로 지원할 수 있는가?
- RQ2고수준 주석과 자동 그래프 최적화는 이질적인 GPU 클러스터에서 트리리언 파라미터 모델의 효율적 훈련을 가능하게 하는가?
- RQ3하드웨어 이질성은 어떻게 효과적으로 관리되어 거대 모델 훈련에서 워크로드를 균형 잡고 버티브로드를 방지할 수 있는가?
- RQ41000억에서 1조 파라미터의 모델 크기 범위에서 통합 프레임워크의 성능 및 확장성은 어떠한가?
- RQ5복잡한 하이브리드 병렬 전략을 포함한 대규모 분산 훈련에 대해 그래프 최적화 기법은 효과적으로 적용될 수 있는가?
주요 결과
- Whale은 이질적인 V100 GPU 512개로 구성된 클러스터에서 10조 파라미터 멀티모odal 모델(M6)을 성공적으로 훈련시켜 강력한 확장성을 입증했다.
- 다른 모델 컴포넌트에 대해 데이터 병렬과 모델 병렬을 조합함으로써 기울기 동기화 오버헤드를 89.7% 감소시켰다.
- 코드 변경 없이 1000억 파라미터에서 10조 파라미터로의 훈련 스케일링이 가능하여 프레임워크의 유연성과 사용성에 기여했다.
- 하드웨어 인지적 로드 밸런싱 알고리즘이 계산 및 메모리 워크로드를 효과적으로 균형 잡아 이질적인 GPU에서 성능 향상을 이뤘다.
- 고수준 추상화를 통해 사용자 노력은 줄였지만 높은 효율성과 확장성을 유지함으로써 기존 프레임워크를 능가했다.
- 480개의 V100 GPU에서 1조 파라미터 모델을 효율적으로 훈련시켜 2048개의 TPU 코어에서의 최첨단 성능과 유사한 결과를 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.