Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Learning Training in Facebook Data Centers: Design of Scale-up and Scale-out Systems

Maxim Naumov, John Kim|arXiv (Cornell University)|2020. 03. 20.
Advanced Graph Neural Networks참고 문헌 34인용 수 54
한 줄 요약

이 논문은 8개의 CPU 소켓과 8개의 가속기로 구성된 Facebook의 스케일업 트레이닝 플랫폼 Zion을 제시하고, 데이터- 및 모델-병렬성, 토폴로지 인식 통신 및 RDMA 트랜스포트를 사용한 딥 러닝 추천 모델(DLRMs)의 향후 scale-out 학습에 대한 설계 고려사항을 논의한다.

ABSTRACT

Large-scale training is important to ensure high performance and accuracy of machine-learning models. At Facebook we use many different models, including computer vision, video and language models. However, in this paper we focus on the deep learning recommendation models (DLRMs), which are responsible for more than 50% of the training demand in our data centers. Recommendation models present unique challenges in training because they exercise not only compute but also memory capacity as well as memory and network bandwidth. As model size and complexity increase, efficiently scaling training becomes a challenge. To address it we design Zion - Facebook's next-generation large-memory training platform that consists of both CPUs and accelerators. Also, we discuss the design requirements of future scale-out training systems.

연구 동기 및 목표

  • 데이터 센터에서의 딥 러닝 학습에 대한 증가하는 계산 및 메모리 수요를 동기 부여합니다.
  • Zion 하드웨어 플랫폼 및 그 메모리/계산 특성을 설명합니다.
  • 향후 scale-out 학습 시스템의 설계 요구사항과 인터커넥트 및 가속기에 미치는 영향을 식별합니다.

제안 방법

  • 임베딩 테이블이 있는 Dense 및 Sparse 특징의 DLRM 작업 부하와 그 구성를 설명합니다.
  • 데이터- 및 모델-병렬 학습 매핑과 allreduce 및 alltoall 프리미티브의 사용을 설명합니다.
  • 8소켓 CPU와 8개의 가속기로 구성된 Zion scale-up 설계와 공급업체에 구애받지 않는 가속기용 모듈인 Open Accelerator Module (OAM)의 제시를 합니다.
  • 인터커넥션 네트워크 선택(CPU 패브릭, 가속기 패브릭, PCIe)과 이들의 통신 패턴에 미치는 영향을 논의합니다.
  • 테이블 없이, ring 대 fully-connected 토폴로지에 대한 allreduce와 alltoall의 분석적 비교를 통해 토폴로지가 성능에 미치는 효과를 보여줍니다.

실험 결과

연구 질문

  • RQ1DLRMs에서 데이터- 및 모델-병렬 전략이 allreduce 및 alltoall 통신에 어떻게 매핑되는가?
  • RQ2향후 scale-out 학습 시스템을 위한 Zion의 설계 시사점은 무엇인가?
  • RQ3인터커넥트 토폴로지와 트랜스포트가 분산 DLRM 학습에서 동기화 프리미티브(allreduce/alltoall)에 어떤 영향을 미치는가?
  • RQ4벤더에 구애받지 않는 가속기 형태(OAM)의 역할은 무엇인가?

주요 결과

  • DLRMs는 임베딩 테이블과 Dense MLP 때문에 데이터-와 모델-병렬 필요; 임베딩은 alltoall, Dense는 allreduce를 유발한다.
  • Zion은 8 CPU 소켓과 8개의 가속기를 제공하여 CPU와 가속기 간의 메모리/계산 트레이드오프를 강조한다.
  • 비동기 학습은 작업의 호스트 수가 증가해도 처리량이 거의 선형으로 스케일되지만, 트레이너 수가 증가하면 동기식 옵션이 필요해진다.
  • 토폴로지 및 트랜스포트 선택(ring 대 fully-connected, GDR/RDMA)은 allreduce 및 alltoall 성능에 상당한 영향을 주며, 작은 메시지에 더 큰 혜택이 있고 scale-out에서 alltoall 대역폭이 결정적이 된다.
  • Open Accelerator Module (OAM)은 벤더-에 구애받지 않는 가속기 통합을 가능하게 하며, 유연하고 확장 가능한 학습 아키텍처를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.