Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Fast and Communication-Efficient Algorithms in Large-scale Distributed Networks

Yue Yu, Jiaxiang Wu|arXiv (Cornell University)|Jan 25, 2019
Sparse and Compressive Sensing Techniques被引用数 6
ひとこと要約

本稿では、通信コストを低減しつつ収束性を維持する大規模分散学習のための通信効率の良いアルゴリズムであるLPC-SVRGとALPC-SVRGを提案する。これらの手法は、量子化されたSVRGに勾配クリッピングを統合することで、通信オーバーヘッドを削減する。新規の量子化方式を用い、クリッピングと二重サンプリングを組み合わせて、完全精度と低精度の勾配を統合することで、線形モデルおよび深層学習モデルにおいて、完全精度SGDと同等の収束速度で通信コストを最大92.86倍まで削減する。

ABSTRACT

The communication overhead has become a significant bottleneck in data-parallel network with the increasing of model size and data samples. In this work, we propose a new algorithm LPC-SVRG with quantized gradients and its acceleration ALPC-SVRG to effectively reduce the communication complexity while maintaining the same convergence as the unquantized algorithms. Specifically, we formulate the heuristic gradient clipping technique within the quantization scheme and show that unbiased quantization methods in related works [3, 33, 38] are special cases of ours. We introduce double sampling in the accelerated algorithm ALPC-SVRG to fully combine the gradients of full-precision and low-precision, and then achieve acceleration with fewer communication overhead. Our analysis focuses on the nonsmooth composite problem, which makes our algorithms more general. The experiments on linear models and deep neural networks validate the effectiveness of algorithms.

研究の動機と目的

  • 勾配伝送が学習時間の大部分を占める大規模分散機械学習システムにおける通信ボトル neck を解消すること。
  • 量子化誤差を低減し収束性を向上させるために、勾配クリッピングを統合した量子化方式を設計し、理論的保証を維持すること。
  • 二重サンプリングを用いて完全精度勾配と低精度勾配を統合することで、通信コストを増加させずに収束速度を向上させる加速アルゴリズムを開発すること。
  • 非滑らかで合成的な最適化問題に対する提案アルゴリズムの収束性を理論的に分析し、凸および非凸設定の両方をカバーすること。
  • 線形モデルおよび深層ニューラルネットワーク上での通信効率と高速収束性を実験的に検証すること。

提案手法

  • 勾配クリッピングを量子化プロセスに統合する新しい量子化方式を提案し、量子化誤差を低減するとともに、先行の不偏量子化手法を特別なケースとして一般化する。
  • 量子化勾配にクリッピングを適用する分散バリアントであるLPC-SVRGを導入し、勾配あたりO(log√d)ビットの通信量で、完全精度SVRGと同等の収束速度を保証する。
  • Katyushaモーメンタムと二重サンプリングを組み合わせ、低精度勾配と完全精度勾配の両方の更新を統合することで、収束速度を向上させる加速版であるALPC-SVRGを開発する。
  • 二重サンプリング機構を採用し、局所的に完全精度勾配を保持しながら、送信するのは量子化済みバージョンのみとして、通信コストを最小限に抑えつつ収束速度を損なわない。
  • 理論的分析により、提案された量子化とクリッピングフレームワーク下で、非滑らかで合成的な最適化問題(非凸目的関数を含む)に対しても収束性が保証されることを証明する。
  • 誤差フィードバックと適応的クリッピングを用いて、量子化とクリッピングによって生じるバイアスを低減し、学習の安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1勾配クリッピングを形式的に量子化方式に統合することで、通信コストを削減しつつ収束性を維持できるか?
  • RQ2二重サンプリングにより低精度勾配と完全精度勾配を統合することで、通信コストを増加させずに収束速度を向上させられるか?
  • RQ3提案されたアルゴリズムが、勾配あたりO(log√d)ビットの通信量で、完全精度手法と同等の漸近的収束速度を達成できるか?
  • RQ4既存の量子化およびスパarsification手法と比較して、通信効率と学習精度の面で優れているか?
  • RQ5作業者数の増加に伴って、大規模分散システムでも効果的にスケーリングできるか?

主な発見

  • YearPredictionMSDデータセットにおいて、LPC-SVRGとALPC-SVRGは、完全精度SGDと比較して、それぞれ最大46.16倍および92.86倍の通信コスト削減を達成し、同程度の訓練損失を示した。
  • ResNet-20を用いたCIFAR-10では、ALPC-SVRGが完全精度SGDと比較して送信ビット数を90%以上削減し、同等のテスト誤差を達成した。
  • 完全精度SVRGよりも収束が速く、訓練に要する計算時間と送信時間の両方でALPC-SVRGが最少であった。
  • クリッピングを施した新規量子化方式は、先行の不偏量子化手法を一般化し、量子化誤差を低減することでモデル精度を向上させた。
  • ResNet-50の性能モデリングでは、GPU数が増加する大規模GPUクラスタにおいて、ALPC-SVRGが完全精度SVRGに比べて顕著な高速化を達成した。
  • 実験により、ALPC-SVRGが線形モデルおよび深層ニューラルネットワークの両方で、高速収束性と低通信コストを維持することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。