Skip to main content
QUICK REVIEW

[논문 리뷰] Survey on Large Scale Neural Network Training

Julia Gusak, Daria Cherniuk|arXiv (Cornell University)|2022. 02. 21.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 종합적 서베이는 단일 또는 다중 GPU 시스템에서 대규모 딥 네트워크를 효율적으로 훈련시키기 위한 기법들을 종합적으로 분석한다. 메모리 절감을 위한 재재현(rematerialization) 및 오프로딩, 데이터, 모델, 파이프라인 병렬화를 포함한 병렬 훈련 전략, 기울기 압축 및 저정밀 산술을 활용한 최적화 기법을 포함하며, 모델 또는 하드웨어 변경 없이 더 큰 배치 크기와 향상된 계산 효율성을 가능하게 한다.

ABSTRACT

Modern Deep Neural Networks (DNNs) require significant memory to store weight, activations, and other intermediate tensors during training. Hence, many models do not fit one GPU device or can be trained using only a small per-GPU batch size. This survey provides a systematic overview of the approaches that enable more efficient DNNs training. We analyze techniques that save memory and make good use of computation and communication resources on architectures with a single or several GPUs. We summarize the main categories of strategies and compare strategies within and across categories. Along with approaches proposed in the literature, we discuss available implementations.

연구 동기 및 목표

  • 모델 또는 하드웨어 변경 없이 대규모 DNN 훈련의 효율성을 향상시키는 일반적이고 침습적이지 않은 기법을 규명하는 것.
  • 단일 GPU에서 큰 모델 파라미터, 활성화, 최적화기 상태로 인한 메모리 병목 현상을 해결하는 것.
  • 다중 GPU 훈련 환경에서 통신 및 계산 효율성을 최적화하는 것.
  • 대규모 DNN 훈련에서 메모리, 계산, 통신 간의 상호 교환 관계를 평가하는 것.
  • 기존 기법들 간의 체계적 비교 및 현대 딥 러닝 프레임워크에 통합된 방식을 제공하는 것.

제안 방법

  • 백프로파게이션 중에 활성화를 재계산함으로써 GPU 메모리 사용량을 줄이는 재재현(rematerialization) 기법.
  • CPU 또는 시스템 메모리로 활성화 및 가중치 오프로딩을 통해 GPU 메모리 용량을 확장하는 기법.
  • 기울기 및 최적화기 상태에 대한 혼합 정밀도 및 저비트 양자화를 활용해 메모리 및 통신 비용을 감소시키는 기법.
  • 데이터, 모델, 파이프라인 모델 병렬화를 활용해 메모리 및 계산을 여러 GPU에 분산시키는 기법.
  • 기울기 압축 및 통신 효율적인 최적화 기법(예: LAMB, LARS)을 적용해 GPU 간 데이터 교환을 줄이는 기법.
  • 체크포인팅 및 하이브리드 전략(예: 오프로딩 + 재재현)을 통합해 메모리 및 계산 오버헤드를 균형 잡는 기법.

실험 결과

연구 질문

  • RQ1단일 GPU에서 대규모 DNN에 대해 가장 효과적인 메모리 절감 기법은 무엇인가?
  • RQ2다양한 병렬화 전략(데이터, 모델, 파이프라인)이 통신, 계산, 메모리 효율성에 어떤 영향을 미치는가?
  • RQ3기울기 압축 및 저정밀 산술이 훈련 확장성에 얼마나 기여하는가?
  • RQ4재재현 및 오프로딩 전략이 병렬 훈련과 함께 조합될 경우 상호작용은 어떻게 되는가?
  • RQ5이러한 최적화 기법을 사용할 경우 훈련 속도, 메모리 사용량, 모델 수렴성 간의 상충 관계는 어떠한가?

주요 결과

  • 재재현은 계산 오버헤드가 최소한이면서도 단일 GPU에서 상당한 메모리 절감을 가능하게 하며, 오프로딩과 조합될 경우 더욱 효과적이다.
  • 활성화 및 가중치의 오프로딩은 GPU 메모리 용량을 초과하는 모델 훈련을 가능하게 하지만, 통신 비용이 증가한다.
  • 기울기 압축 및 저정밀 산술은 다중 GPU 훈련에서 통신 부담을 감소시켜 확장성을 향상시키며, 수렴에 미치는 영향은 최소한이다.
  • 파이프라인 및 모델 병렬화는 GPU당 메모리 사용량을 줄이지만 통신 비용을 증가시키며, 기울기 압축을 통해 이를 완화할 수 있다.
  • 재재현과 오프로딩의 조합은 단독으로 사용할 경우보다 더 높은 메모리 효율성을 달성할 수 있다.
  • LAMB 및 LARS와 같은 최적화 기법은 혼합 정밀도 훈련과 조합될 경우 더 큰 배치 크기로 안정적이고 빠른 수렴을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.