Skip to main content
QUICK REVIEW

[論文レビュー] Bandwidth Reduction using Importance Weighted Pruning on Ring AllReduce

Zehua Cheng, Zhenghua Xu|arXiv (Cornell University)|Jan 6, 2019
Advanced Neural Network Applications参考文献 19被引用数 8
ひとこと要約

この論文では、大規模なディープラーニング学習における通信帯域幅を削減するため、リングアラールーティングに重要度に基づくプルーニングを提案する。勾配の大きさとパラメータ値の比に基づき、動的に重要度の低い勾配をプルーニングし、確率的インデックスブロードキャストを用いることで、AlexNetでは最大64倍、ResNet50では58.8倍の勾配圧縮を達成した。96ノードのクラスタでGTX 1080Ti GPUのみを用いても、モデルの精度を維持した。

ABSTRACT

It is inevitable to train large deep learning models on a large-scale cluster equipped with accelerators system. Deep gradient compression would highly increase the bandwidth utilization and speed up the training process but hard to implement on ring structure. In this paper, we find that redundant gradient and gradient staleness has negative effect on training. We have observed that in different epoch and different steps, the neural networks focus on updating different layers and different parameters. In order to save more communication bandwidth and preserve the accuracy on ring structure, which break the restrict as the node increase, we propose a new algorithm to measure the importance of gradients on large-scale cluster implementing ring all-reduce based on the size of the ratio of parameter calculation gradient to parameter value. Our importance weighted pruning approach achieved 64X and 58.8X of gradient compression ratio on AlexNet and ResNet50 on ImageNet. Meanwhile, in order to maintain the sparseness of the gradient propagation, we randomly broadcast the index of important gradients on each node. While the remaining nodes are ready for the index gradient and perform all-reduce update. This would speed up the convergence of the model and preserve the training accuracy.

研究の動機と目的

  • リングアラールーティングトポロジーにおける大規模分散ディープラーニング学習の通信ボトルネックを軽減すること。
  • 特にノード数が増加する中で、モデルの精度を損なわず帯域幅の使用量を削減すること。
  • ノード数の増加に伴い勾配がより密になるリング構造におけるディープ勾配圧縮の限界を克服すること。
  • 高価なネットワーキング技術(例:Infiniband)を用いずに、コンsumerクラスGPU(例:GTX 1080Ti)のみで大規模クラスタにおける効率的かつ高帯域幅の利用を可能にすること。
  • 動的かつレイヤー単位の勾配重要度推定により、収束速度とモデルパフォーマンスを維持すること。

提案手法

  • 勾配の重要度を、勾配の大きさとパラメータ値の比(|∇w| / |w|)を用いて測定し、重要でない更新を特定する。
  • レイヤー間の勾配重要度の分散対平均比に基づき、動的しきい値を設定し、プルーニングを適応的に制御する。
  • レイヤー単位の重要度に基づくプルーニングを実行し、高重要度の勾配のみを送信し、残りはローカルに蓄積する。
  • 重要な勾配のインデックスをノード間でランダムにブロードキャストし、スパarsityを維持し、正しいアラールーティング更新を可能にする。
  • 重要度が低い勾配に対して確率的更新ルールを適用し、スタリネスを防ぎ、収束性を維持する。
  • 最適化の初期段階での安定化のため、ウォームアップ学習とローカル勾配クリッピングを採用する。

実験結果

リサーチクエスチョン

  • RQ1モデル精度を損なわず、リングアラールーティングトポロジーに勾配スパース化を効果的に適用する方法は何か?
  • RQ2大規模分散学習において、冗長または重要でない勾配を信頼性高く特定する指標は何か?
  • RQ3勾配のスタリネスは収束にどのように影響するか?スパース通信方式においては、その影響をどのように軽減できるか?
  • RQ4ノード数の増加に伴い勾配密度が上昇するにもかかわらず、リング構造においてディープ勾配圧縮を意味的に適用可能か?
  • RQ5動的学習シナリオにおいて、帯域幅の削減とモデルパフォーマンスの両立を最適に実現するしきい値戦略は何か?

主な発見

  • 提案手法は、ImageNet学習においてAlexNetで64倍、ResNet50で58.8倍の勾配圧縮比を達成し、固定しきい値ベースラインを顕著に上回った。
  • レイヤー単位のしきい値設定により、ResNet50では76.31%のトップ-1精度を維持し、ベースライン(76.09%)をわずかに上回りながらも47.6倍の圧縮を達成した。
  • ネットワークI/O帯域幅が顕著に削減され、Infinibandを用いずにギガビットスピードで効果的な通信が維持された。
  • 勾配重要度の分散対平均比は、適応的しきい値調整のための重要な指標であることが判明し、収束安定性の向上に寄与した。
  • 従来のディープ勾配圧縮は、ノード数の増加に伴い勾配密度が上昇するリング構造では失敗したが、本手法は動的プルーニングによりこれを克服した。
  • 本手法により、GTX 1080Ti GPUのみを用いた96ノードクラスタでも学習が可能となり、Infinibandのような高価なネットワーキング技術の導入を回避できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。