Skip to main content
QUICK REVIEW

[논문 리뷰] PowerAI DDL

Minsik Cho, Ulrich Finkler|arXiv (Cornell University)|2017. 08. 07.
Advanced Neural Network Applications참고 문헌 4인용 수 5
한 줄 요약

PowerAI DDL은 분산 딥러닝을 위한 소프트웨어-하드웨어 공동 설계 시스템으로, 다중링 커뮤니케이션 패턴을 사용하여 수백 개의 GPU에서 거의 선형적 스케일링을 달성한다. 이 시스템은 256개의 GPU를 사용해 ImageNet-22K에서 ResNet-101을 약 7시간 내에 학습시켜 33.8%의 검증 정확도를 달성하고, ResNet-50의 90 에포크 학습을 50분 내에 완료하며, 기존 시스템 대비 커뮤니케이션 효율성과 정확도에서 뛰어난 성능을 보인다.

ABSTRACT

As deep neural networks become more complex and input datasets grow larger, it can take days or even weeks to train a deep neural network to the desired accuracy. Therefore, distributed Deep Learning at a massive scale is a critical capability, since it offers the potential to reduce the training time from weeks to hours. In this paper, we present a software-hardware co-optimized distributed Deep Learning system that can achieve near-linear scaling up to hundreds of GPUs. The core algorithm is a multi-ring communication pattern that provides a good tradeoff between latency and bandwidth and adapts to a variety of system configurations. The communication algorithm is implemented as a library for easy use. This library has been integrated into Tensorflow, Caffe, and Torch. We train Resnet-101 on Imagenet 22K with 64 IBM Power8 S822LC servers (256 GPUs) in about 7 hours to an accuracy of 33.8 % validation accuracy. Microsoft's ADAM and Google's DistBelief results did not reach 30 % validation accuracy for Imagenet 22K. Compared to Facebook AI Research's recent paper on 256 GPU training, we use a different communication algorithm, and our combined software and hardware system offers better communication overhead for Resnet-50. A PowerAI DDL enabled version of Torch completed 90 epochs of training on Resnet 50 for 1K classes in 50 minutes using 64 IBM Power8 S822LC servers (256 GPUs).

연구 동기 및 목표

  • 수천 개의 GPU에서 분산 학습을 가능하게 함으로써 딥러닝 학습 시간을 수주에서 수시간으로 단축시키기 위해 설계한다.
  • 수백 개의 GPU에서 분산 딥러닝의 커뮤니케이션 병목 현상을 해결하기 위해 설계한다.
  • 다양한 시스템 구성에 적응할 수 있는 커뮤니케이션 알고리즘을 설계하여 지연 시간과 대역폭 간의 균형을 유지한다.
  • TensorFlow, Caffe, Torch와 같은 주요 프레임워크에 통합하여 광범위한 사용성을 확보한다.
  • 대규모 ImageNet-22K 데이터셋에서 Microsoft의 ADAM과 Google의 DistBelief와 같은 기존 시스템 대비 뛰어난 학습 성능과 정확도를 달성한다.

제안 방법

  • 시스템은 GPU 클러스터에서 커뮤니케이션 지연 시간과 대역폭 간의 트레이드오���트를 최적화하는 다중링 커뮤니케이션 패턴을 사용한다.
  • 커뮤니케이션 알고리즘은 재사용 가능한 라이브러리로 구현되어 TensorFlow, Caffe, Torch와 같은 딥러닝 프레임워크에 통합될 수 있다.
  • 소프트웨어와 하드웨어가 공동 최적화되어, 64대의 IBM Power8 S822LC 서버와 256개의 GPU를 사용해 높은 확장성을 달성한다.
  • 다중링 패턴은 다양한 시스템 구성에 동적으로 적응하여 다양한 하드웨어 환경에서도 일관된 성능을 보장한다.
  • 동기식 확률적 경사 하강법에서 핵심적인 역할을 하는 효율적인 all-reduce 연산을 지원한다.
  • ResNet-101과 ResNet-50을 대규모 ImageNet-22K에서 엔드 투 엔드로 학습시켜 시스템의 구현을 검증한다.

실험 결과

연구 질문

  • RQ1공동 설계된 소프트웨어-하드웨어 시스템이 분산 딥러닝에서 수백 개의 GPU에서 거의 선형적 스케일링을 달성할 수 있는가?
  • RQ2다중링 커뮤니케이션 패턴은 지연 시간, 대역폭, 적응 가능성 측면에서 다른 커뮤니케이션 전략과 비교해 어떻게 성능을 냈는가?
  • RQ3최소한의 커뮤니케이션 오버헤드로 256개의 GPU를 사용해 대규모 ImageNet-22K에서 어떤 정도의 학습 정확도를 달성할 수 있는가?
  • RQ4PowerAI DDL의 성능은 ADAM과 DistBelief와 같은 기존 시스템과 대규모 벤치마크에서 어떻게 비교되는가?
  • RQ5TensorFlow, Caffe, Torch와 같은 주요 딥러닝 프레임워크에 커뮤니케이션 라이브러리가 얼마나 효율적으로 통합될 수 있는가?

주요 결과

  • 64대의 IBM Power8 S822LC 서버(256개의 GPU)를 사용해 ImageNet-22K에서 ResNet-101을 학습시켜 약 7시간 만에 33.8%의 검증 정확도를 달성했다.
  • Microsoft의 ADAM과 Google의 DistBelief는 ImageNet-22K에서 30% 이하의 검증 정확도를 달성하지 못했으며, 이는 PowerAI DDL이 속도와 정확도 면에서 이 시스템들을 능가함을 시사한다.
  • PowerAI DDL을 통한 Torch 구현은 256개의 GPU를 사용해 1,000개 클래스의 ResNet-50 학습을 90 에포크 동안 50분 내에 완료했다.
  • 수백 개의 GPU에서 거의 선형적 스케일링 효율성을 보이며, 학습 시간을 수일에서 수시간으로 크게 단축시켰다.
  • Facebook AI Research의 256 GPU 학습과 비교해, PowerAI DDL은 최적화된 다중링 커뮤니케이션 패턴 덕분에 ResNet-50에 대해 더 낮은 커뮤니케이션 오버헤드를 달성했다.
  • TensorFlow, Caffe, Torch에 커뮤니케이션 라이브러리가 성공적으로 통합되어 주요 딥러닝 프레임워크 전반에서 넓은 사용성을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.