[論文レビュー] PowerAI DDL
PowerAI DDL は、数百の GPU でほぼ線形スケーリングを達成するための共同設計されたソフトウェア・ハードウェアシステムであり、マルチリング通信パターンを採用している。これにより、ImageNet-22K で ResNet-101 を約 7 時間(検証精度 33.8%)でトレーニング可能であり、256 個の GPU を使用して ResNet-50 の 90 エポック分のトレーニングを 50 分で完了する。通信効率と精度の点で、先行するシステムを上回っている。
As deep neural networks become more complex and input datasets grow larger, it can take days or even weeks to train a deep neural network to the desired accuracy. Therefore, distributed Deep Learning at a massive scale is a critical capability, since it offers the potential to reduce the training time from weeks to hours. In this paper, we present a software-hardware co-optimized distributed Deep Learning system that can achieve near-linear scaling up to hundreds of GPUs. The core algorithm is a multi-ring communication pattern that provides a good tradeoff between latency and bandwidth and adapts to a variety of system configurations. The communication algorithm is implemented as a library for easy use. This library has been integrated into Tensorflow, Caffe, and Torch. We train Resnet-101 on Imagenet 22K with 64 IBM Power8 S822LC servers (256 GPUs) in about 7 hours to an accuracy of 33.8 % validation accuracy. Microsoft's ADAM and Google's DistBelief results did not reach 30 % validation accuracy for Imagenet 22K. Compared to Facebook AI Research's recent paper on 256 GPU training, we use a different communication algorithm, and our combined software and hardware system offers better communication overhead for Resnet-50. A PowerAI DDL enabled version of Torch completed 90 epochs of training on Resnet 50 for 1K classes in 50 minutes using 64 IBM Power8 S822LC servers (256 GPUs).
研究の動機と目的
- 大規模分散トレーニングを可能にすることで、深層学習のトレーニング時間を数週間から数時間に短縮すること。
- 数百の GPU を超える分散深層学習における通信ボトル neck 問題を解決すること。
- さまざまなシステム構成に適応可能な通信アルゴリズムを設計し、レイテンシと帯域幅のバランスを取ること。
- TensorFlow や Caffe、Torch といった人気フレームワークへの統合を通じて、広範な使いやすさを実現すること。
- 大規模な ImageNet-22K データセットにおいて、既存のシステム(例:Microsoft の ADAM や Google の DistBelief)と比較して優れたトレーニングパフォーマンスと精度を達成すること。
提案手法
- システムは、GPU クラスタ全体における通信レイテンシと帯域幅のトレードオフを最適化するマルチリング通信パターンを採用している。
- 通信アルゴリズムは再利用可能なライブラリとして実装されており、TensorFlow や Caffe、Torch などの深層学習フレームワークへの統合が可能である。
- ソフトウェare とハードウェアが共同最適化されており、64 台の IBM Power8 S822LC サーバー(合計 256 個の GPU)を用いて高いスケーラビリティを実現している。
- マルチリングパターンは、さまざまなシステム構成に動的に適応可能であり、異なるハードウェア環境でも一貫したパフォーマンスを発揮する。
- 同期的確率的勾配降下法における重要な演算である all-reduce 操作を効率的にサポートしている。
- ResNet-101 および ResNet-50 の ImageNet-22K におけるエンドツーエンドのスケールトレーニングを通じて、実装の妥当性が検証された。
実験結果
リサーチクエスチョン
- RQ1共同設計されたソフトウェア・ハードウェアシステムは、数百の GPU で分散深層学習においてほぼ線形スケーリングを達成できるか?
- RQ2マルチリング通信パターンは、レイテンシ、帯域幅、適応性の観点から、他の通信戦略と比較してどのように異なるか?
- RQ3通信オーバーヘッドを最小限に抑えた状態で、256 個の GPU を用いて大規模な ImageNet-22K でどの程度のトレーニング精度が達成できるか?
- RQ4PowerAI DDL のパフォーマンスは、ADAM や DistBelief といった既存のシステムと比較して、大規模ベンチマークでどの程度優れているか?
- RQ5TensorFlow や Caffe、Torch といった人気フレームワークへの通信ライブラリの統合は、どの程度効率的に行えるか?
主な発見
- 64 台の IBM Power8 S822LC サーバー(合計 256 個の GPU)を用いて、ImageNet-22K で ResNet-101 をトレーニングしたところ、約 7 時間で検証精度 33.8% を達成した。
- Microsoft の ADAM や Google の DistBelief は、ImageNet-22K で 30% 未満の検証精度にとどまり、PowerAI DDL が速度と精度の両面でこれらを上回っていることが示された。
- PowerAI DDL を搭載した Torch 実装により、1,000 クラスの ResNet-50 トレーニングを 256 個の GPU で 50 分間で 90 エポック分完了した。
- 数百の GPU にわたり、ほぼ線形のスケーリング効率を示しており、トレーニング時間を数日から数時間に劇的に短縮した。
- Facebook AI Research の 256 GPU トレーニングと比較して、PowerAI DDL は最適化されたマルチリング通信パターンのおかげで、ResNet-50 の通信オーバーヘッドを低減した。
- 通信ライブラリは TensorFlow、Caffe、Torch に正常に統合され、主要な深層学習フレームワークにおける広範な利用可能性が実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。