[論文レビュー] Nested Dithered Quantization for Communication Reduction in Distributed Training
本稿では、分散型ディープラーニングにおける通信オーバーヘッドを低減するため、デザイタード・クオンタイゼーション(DQSG)およびネストド・デザイタード・クオンタイゼーション(NDQSG)を提案する。勾配を量子化する前に制御されたデザイタを追加することで、DQSGは量子化誤差が勾配とは独立することを保証し、収束の安定性を実現する。NDQSGは、異なるワーカー間の勾配相関を活用して、性能に損なわれることなく30%のビット削減を達成し、1ビット法やQSGDを上回る精度と収束速度を実現する。
In distributed training, the communication cost due to the transmission of gradients or the parameters of the deep model is a major bottleneck in scaling up the number of processing nodes. To address this issue, we propose \\emph{dithered quantization} for the transmission of the stochastic gradients and show that training with \\emph{Dithered Quantized Stochastic Gradients (DQSG)} is similar to the training with unquantized SGs perturbed by an independent bounded uniform noise, in contrast to the other quantization methods where the perturbation depends on the gradients and hence, complicating the convergence analysis. We study the convergence of training algorithms using DQSG and the trade off between the number of quantization levels and the training time. Next, we observe that there is a correlation among the SGs computed by workers that can be utilized to further reduce the communication overhead without any performance loss. Hence, we develop a simple yet effective quantization scheme, nested dithered quantized SG (NDQSG), that can reduce the communication significantly \\emph{without requiring the workers communicating extra information to each other}. We prove that although NDQSG requires significantly less bits, it can achieve the same quantization variance bound as DQSG. Our simulation results confirm the effectiveness of training using DQSG and NDQSG in reducing the communication bits or the convergence time compared to the existing methods without sacrificing the accuracy of the trained model.
研究の動機と目的
- モデルの精度を損なわず、分散型ディープラーニングのトレーニングにおける通信オーバーヘッドを低減すること。
- 従来の量子化手法の限界、すなわち量子化誤差が入力勾配に依存するため収束解析が複雑になる問題を解決すること。
- 異なるワーカーから得られる確率的勾配の相関を活用して、さらなる通信ビット数の削減を図ること。
- 同期および非同期のトレーニングフレームワークと両立可能なスケーラブルで低ビットの量子化スキームを開発すること。
提案手法
- 勾配に量子化の前に一様なランダムなデザイタ信号を追加することで、確率的勾配にデザイタード・クオンタイゼーションを適用し、誤差が入力勾配とは独立することを保証する。
- ステップサイズΔのM段階の均等クオンタイザを用い、出力はQ(v) = Δ·⌊v/Δ⌉と定義する。デザイタはU[−Δ/2, Δ/2]から抽出される。
- 最初に勾配を粗いレベルにクオンタイズし、その後でより細かいクオンタイゼーションを用いてサブグループを精錬する、階層的クオンタイゼーションを適用するネストド・デザイタード・クオンタイゼーション(NDQSG)を提案する。
- ワーカー間での勾配相関をモデル化し、それをもとに、量子化分散を維持したままビット使用量を削減するネスト構造を設計する。
- エントロピー符号化を適用して、さらに量子化済み勾配を圧縮し、モデル性能に影響を与えることなくビットレートを低減する。
- NDQSGがDQSGと同等の量子化分散の上限を維持することを証明し、収束行動が同等であることを保証する。
実験結果
リサーチクエスチョン
- RQ1デザイタード・クオンタイゼーションにより、量子化誤差を勾配値から分離することで、分散学習における収束の安定化が達成できるか?
- RQ2量子化レベルの数が、分散SGDにおける収束速度と通信コストに与える影響は何か?
- RQ3異なるワーカー間の確率的勾配の相関を活用することで、量子化分散を増加させることなく通信ビット数を削減可能か?
- RQ4ネストド・デザイタード・クオンタイゼーションは、標準的なデザイタード・クオンタイゼーションと同等のトレーニング精度と収束速度を達成しつつ、顕著に少ないビット数を用いることができるか?
主な発見
- DQSGは1ビット量子化と比較して通信ビット数を最大6倍まで削減でき、精度損失は最小限である。例えば、FC300-100ではエントロピー符号化後、1ワーカーあたり38.6 Kbitsにまで低減される。
- NDQSGはDQSGと比較して30%以上の通信削減を達成し、FC300-100ではDQSGの619.2 Kbits/workerと比較して422.8 Kbits/workerを達成する。
- 8ワーカーを用いたCifarNetでは、NDQSGは50エポック後に64.1%の精度を達成し、DQSGと同等であり、QSGD(64.1%)および1ビット量子化(47.8%)を上回る。
- DQSGは、勾配の値とは独立したノイズ構造を有するため、ベースラインと比較してトレーニングイテレーションの観点でより速く収束することが示唆される。
- ワーカー数が増加するに従い、勾配平均化の効果により、量子化済みと未量子化のトレーニング間の収束ギャップが縮小する。これはスケーラビリティを裏付ける。
- NDQSGはDQSGと同等のトレーニング精度と収束速度を維持しながら、ビット使用量を削減するため、低帯域幅の分散システムにおいて有効であることが証明された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。