Skip to main content
QUICK REVIEW

[論文レビュー] 2.5-dimensional distributed model training.

Boxiang Wang, Qifan Xu|arXiv (Cornell University)|May 30, 2021
Topic Modeling参考文献 9被引用数 8
ひとこと要約

本稿では、SUMMAと2.5次元行列乗算の原則を組み合わせることで通信オーバーヘッドを低減する2.5次元分散テンソル並列化手法であるSUMMA2.5-LMを提案する。2D [8,8,1] と比較して弱スケーリングにおいて1.45倍高い効率を達成し、大規模クラスタ上でのスケーリング効率を向上させる。

ABSTRACT

Data parallelism does a good job in speeding up the training. However, when it comes to the case when the memory of a single device can not host a whole model, data parallelism would not have the chance to do anything. Another option is to split the model by operator, or horizontally. Megatron-LM introduced a 1-Dimensional distributed method to use GPUs to speed up the training process. Optimus is a 2D solution for distributed tensor parallelism. However, these methods have a high communication overhead and a low scaling efficiency on large-scale computing clusters. To solve this problem, we investigate the 2.5-Dimensional distributed tensor parallelism.Introduced by Solomonik et al., 2.5-Dimensional Matrix Multiplication developed an effective method to perform multiple Cannon's algorithm at the same time to increase the efficiency. With many restrictions of Cannon's Algorithm and a huge amount of shift operation, we need to invent a new method of 2.5-dimensional matrix multiplication to enhance the performance. Absorbing the essence from both SUMMA and 2.5-Dimensional Matrix Multiplication, we introduced SUMMA2.5-LM for language models to overcome the abundance of unnecessary transmission loss result from the increasing size of language model parallelism. Compared to previous 1D and 2D model parallelization of language models, our SUMMA2.5-LM managed to reduce the transmission cost on each layer, which could get a 1.45X efficiency according to our weak scaling result between 2.5-D [4,4,4] arrangement and 2-D [8,8,1] arrangement.

研究の動機と目的

  • 大規模言語モデルにおける既存の1次元および2次元モデル並列化手法の高通信オーバーヘッドと低スケーリング効率を解決すること。
  • モデルサイズが単一デバイスのメモリ容量を超えるようになるに従い、モデル並列化における伝送コストを低減すること。
  • 不要なデータ移動を最小限に抑えつつ高い計算効率を維持する新しい2.5次元行列乗算技術を設計すること。
  • SUMMAと2.5次元行列乗算のハイブリッド通信パターンを活用することで、大規模コンピューティングクラスタ上でのスケーリング効率を向上させること。

提案手法

  • 2.5次元行列乗算の原則をモデル並列化に適応し、複数のCannon類似アルゴリズムを同時に実行可能にする。
  • 従来のCannon法と比較して、シフト操作と通信ボトルネックを低減する新しい2.5次元行列乗算法を導入する。
  • SUMMA(スケーラブルな通信)と2.5次元行列乗算(負荷分散とデータ移動の削減)の長所を統合したフレームワークを構築する。
  • デバイス全体にわたる3次元テンソルタイリング戦略を用い、2.5次元では[4,4,4]、2次元では[8,8,1]の次元を採用することで、データ配布を最適化し、重複送信を削減する。
  • アイドル時間を最小限に抑え、フォワードおよびバックワードパス中にGPU間で負荷をバランスさせる通信最適化パイプラインを設計する。
  • 中間結果を層間で再利用することで、重複するデータ転送を削減するハイブリッド通信パターンを採用する。

実験結果

リサーチクエスチョン

  • RQ12.5次元テンソル並列化は、1次元および2次元手法と比較して、大規模言語モデル学習における通信オーバーヘッドをどのように低減できるか?
  • RQ2シフト操作と重複するデータ送信の最小化が、分散モデル学習におけるスケーリング効率に与える影響は何か?
  • RQ3SUMMAと2.5次元行列乗算を統合したハイブリッド手法は、通信コストとスループットの観点で、既存の2次元および1次元並列化戦略を上回ることができるか?
  • RQ4弱スケーリング効率において、2.5次元[4,4,4]配置は2次元[8,8,1]配置と比較してどのように異なるか?
  • RQ5大規模言語モデルに本手法SUMMA2.5-LMを適用した場合、学習効率にどの程度の向上が達成できるか?

主な発見

  • 提案されたSUMMA2.5-LM手法は、モデル並列化におけるデータ移動パターンの最適化により、1層あたりの伝送コストを低減する。
  • 弱スケーリング実験において、2.5次元[4,4,4]配置は2次元[8,8,1]配置よりも1.45倍高い効率を達成する。
  • 不要なデータ送信を最小限に抑えることで、SUMMA2.5-LMは大規模コンピューティングクラスタ上でのスケーリング効率を向上させる。
  • この手法は、従来の1次元および2次元モデル並列化アプローチに内在する通信ボトルネックを効果的に緩和する。
  • SUMMA2.5-LMのハイブリッド設計は、デバイス間での計算負荷のバランスを効果的に維持し、アイドル時間を削減する。
  • 新規2.5次元行列乗算法は、Cannon法と比較してシフト操作と通信オーバーヘッドを低減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。