Skip to main content
QUICK REVIEW

[论文解读] PowerAI DDL

Minsik Cho, Ulrich Finkler|arXiv (Cornell University)|Aug 7, 2017
Advanced Neural Network Applications参考文献 4被引用 5
一句话总结

PowerAI DDL 是一种用于分布式深度学习的软硬件协同设计系统,采用多环通信模式,在数百张GPU上实现近乎线性的扩展。它在约7小时内完成ImageNet-22K上的ResNet-101训练(验证准确率为33.8%),并使用256张GPU在50分钟内完成90轮ResNet-50训练,通信效率和准确率均优于先前系统。

ABSTRACT

As deep neural networks become more complex and input datasets grow larger, it can take days or even weeks to train a deep neural network to the desired accuracy. Therefore, distributed Deep Learning at a massive scale is a critical capability, since it offers the potential to reduce the training time from weeks to hours. In this paper, we present a software-hardware co-optimized distributed Deep Learning system that can achieve near-linear scaling up to hundreds of GPUs. The core algorithm is a multi-ring communication pattern that provides a good tradeoff between latency and bandwidth and adapts to a variety of system configurations. The communication algorithm is implemented as a library for easy use. This library has been integrated into Tensorflow, Caffe, and Torch. We train Resnet-101 on Imagenet 22K with 64 IBM Power8 S822LC servers (256 GPUs) in about 7 hours to an accuracy of 33.8 % validation accuracy. Microsoft's ADAM and Google's DistBelief results did not reach 30 % validation accuracy for Imagenet 22K. Compared to Facebook AI Research's recent paper on 256 GPU training, we use a different communication algorithm, and our combined software and hardware system offers better communication overhead for Resnet-50. A PowerAI DDL enabled version of Torch completed 90 epochs of training on Resnet 50 for 1K classes in 50 minutes using 64 IBM Power8 S822LC servers (256 GPUs).

研究动机与目标

  • 通过实现大规模分布式训练,将深度学习训练时间从数周缩短至数小时。
  • 解决在数百张GPU上分布式深度学习中的通信瓶颈问题。
  • 设计一种能适应多样化系统配置、同时平衡延迟与带宽的通信算法。
  • 将通信库集成到TensorFlow、Caffe和Torch等主流框架中,以实现广泛可用性。
  • 在大规模ImageNet-22K数据集上,相比现有系统(如微软的ADAM和谷歌的DistBelief),实现更优的训练性能与准确率。

提出的方法

  • 该系统采用多环通信模式,优化GPU集群中通信延迟与带宽之间的权衡。
  • 通信算法以可重用库的形式实现,支持集成到TensorFlow、Caffe和Torch等深度学习框架中。
  • 通过软件与硬件的联合优化,利用64台IBM Power8 S822LC服务器(共256张GPU)实现高可扩展性。
  • 多环模式能动态适应不同的系统配置,确保在各种硬件环境下保持一致的性能表现。
  • 框架支持高效的all-reduce操作,这对分布式训练中同步随机梯度下降至关重要。
  • 通过在大规模ImageNet-22K上对ResNet-101和ResNet-50进行端到端训练,验证了实现方案的有效性。

实验结果

研究问题

  • RQ1协同设计的软硬件系统是否能在数百张GPU上实现分布式深度学习中的近乎线性扩展?
  • RQ2与其它通信策略相比,多环通信模式在延迟、带宽和适应性方面表现如何?
  • RQ3在256张GPU上,使用最小通信开销在大规模ImageNet-22K数据集上可达到何种训练准确率?
  • RQ4PowerAI DDL在大规模基准测试中与现有系统(如ADAM和DistBelief)相比性能如何?
  • RQ5通信库在TensorFlow、Caffe和Torch等主流深度学习框架中的集成效率如何?

主要发现

  • 在64台IBM Power8 S822LC服务器(共256张GPU)上,ResNet-101在ImageNet-22K上的训练在约7小时内达到33.8%的验证准确率。
  • 微软的ADAM和谷歌的DistBelief在ImageNet-22K上均未能达到30%的验证准确率,表明PowerAI DDL在速度与准确率方面均优于这些系统。
  • PowerAI DDL支持的Torch实现,在256张GPU上用50分钟完成1000类的ResNet-50训练90轮。
  • 该系统在数百张GPU上展现出近乎线性的扩展效率,将训练时间从数天大幅缩短至数小时。
  • 与Facebook AI Research的256张GPU训练相比,PowerAI DDL因采用优化的多环通信模式,对ResNet-50的通信开销更低。
  • 通信库已成功集成至TensorFlow、Caffe和Torch,实现了在主流深度学习框架中的广泛可用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。