Skip to main content
QUICK REVIEW

[論文レビュー] NetReduce: RDMA-Compatible In-Network Reduction for Distributed DNN Training Acceleration

Shuo Liu, Qiaoling Wang|arXiv (Cornell University)|Sep 21, 2020
Advanced Memory and Neural Computing参考文献 32被引用数 13
ひとこと要約

NetReduce は、コンmodity ハードウェアを変更せずに、スイッチに勾配集約をオフロードすることで分散 DNN 学習を高速化する RDMA 同期のネットワーク内削減アーキテクチャである。FPGA を用いたネットワーク内集約とメッセージ単位のクレジットベースフロー制御、最小限のハードウェア変更により、CNN を用いた CV タスクでは最大 1.7 倍、トランスフォーマーを用いた NLP タスクでは最大 1.5 倍の高速化を達成する。

ABSTRACT

We present NetReduce, a novel RDMA-compatible in-network reduction architecture to accelerate distributed DNN training. Compared to existing designs, NetReduce maintains a reliable connection between end-hosts in the Ethernet and does not terminate the connection in the network. The advantage of doing so is that we can fully reuse the designs of congestion control and reliability in RoCE. In the meanwhile, we do not need to implement a high-cost network protocol processing stack in the switch, as IB does. The prototype implemented by using FPGA is an out-of-box solution without modifying commodity devices such as NICs or switches. For the coordination between the end-host and the switch, NetReduce customizes the transport protocol only on the first packet in a data message to comply with RoCE v2. The special status monitoring module is designed to reuse the reliability mechanism of RoCE v2 for dealing with packet loss. A message-level credit-based flow control algorithm is also proposed to fully utilize bandwidth and avoid buffer overflow. We study the effects of intra bandwidth on the training performance in multi-machines multi-GPUs scenario and give sufficient conditions for hierarchical NetReduce to outperform other algorithms. We also extend the design from rack-level aggregation to more general spine-leaf topology in the data center. NetReduce accelerates the training up to 1.7x and 1.5x for CNN-based CV and transformer-based NLP tasks, respectively. Simulations on large-scale systems indicate the superior scalability of NetReduce to the state-of-the-art ring all-reduce.

研究の動機と目的

  • コンmodity ハードウェアを変更せずに、既存の Ethernet ネットワークに効率的なネットワーク内集約を統合することで、分散 DNN 学習における通信ボトル neck を解消すること。
  • InfiniBand が要求する高価なプロトコルスタックをスイッチに実装する必要がなくなるように、RoCE v2 を用いてエンドツーエンドの信頼性のある接続を維持すること。
  • エンドツーエンドの遅延とバッファオーバーフローのリスクを最小限に抑えることで、大規模なマルチマシン・マルチ GPU 学習におけるスケーラビリティとスループットを向上させること。
  • FPGA を用いた実用的で即時利用可能なソリューションを設計し、既存の RoCE v2 の混雑制御および信頼性メカニズムを完全に再利用すること。
  • スパines-leaf データセンタートポロジーにおける階層的 NetReduce の性能とスケーラビリティを、帯域幅とテンソルサイズの変動条件下で評価すること。

提案手法

  • NetReduce はスイッチでトランスポート層を終了しないことでエンドツーエンドの RoCE v2 接続を維持し、既存の混雑制御および信頼性メカニズムの再利用を可能にする。
  • プロトコル変更を最小限に抑えるために、各メッセージの最初のパケットに特別なトランスポートプロトコルヘッダをカスタマイズして RoCE v2 に準拠する。
  • 専用のステータスモニタリングモジュールが、RoCE v2 の信頼性メカニズムを再利用してパケットロスを検出し、回復するが、複雑なネットワークスタック論理を追加しない。
  • バッファオーバーフローを防止し、高帯域幅ネットワークにおけるリンク利用率を最大化するため、メッセージ単位のクレジットベースフロー制御アルゴリズムを導入する。
  • 大規模なリングをより小さなマシン内リングに分割することで階層的集約をサポートし、エンドツーエンド遅延を低減し、スケーラビリティを向上させる。
  • プロトタイプは FPGA に実装されており、コンsumer NIC やスイッチを変更せずにネットワーク内削減を実現する。これにより、互換性と導入の容易さが保証される。

実験結果

リサーチクエスチョン

  • RQ1RoCE v2 などの RDMA 同期プロトコルを用いて、専用ハードウェアやスイッチのプロトコルスタック変更を要せず、既存の Ethernet ネットワークにネットワーク内集約を効率的に統合できるか。
  • RQ2異なるテンソルサイズと GPU 数の条件下で、階層的ネットワーク内削減とフラットリングすべての削減のスケーラビリティと性能を比較するとどうなるか。
  • RQ3大規模なマルチマシン・マルチ GPU 学習環境において、階層的 NetReduce がフラットリングすべての削減を上回る十分な条件は何か。
  • RQ4SwitchML や SHARP などの既存ソリューションと比較して、FPGA を用いたネットワーク内集約はエンドツーエンドスループットをどの程度向上させるか。
  • RQ5固定小数点演算を用いた勾配集約において、NetReduce は学習の収束性とモデルの正確性を維持できるか。

主な発見

  • NetReduce は、ベースラインのすべての削減手法と比較して、CNN を用いたコンピュータビジョンタスクで最大 1.7 倍、トランスフォーマーを用いた NLP タスクで最大 1.5 倍の高速化を達成する。
  • ネットワーク内削減に固定小数点演算を用いても、学習の収束性が維持されることから、モデルの正確性に顕著な影響がないことが示された。
  • イントラマシン帯域幅が十分に高い場合、階層的 NetReduce はフラットリングすべての削減を上回る。最適性能を得るための閾値比は B_intra/B_inter ≥ 2.3 である。
  • シミュレーションでは、NetReduce の通信コストは GPU 数(P)に依存せず、一方でフラットリングすべての削減の遅延は 2(P-1) の送信要因により P に線形に増加する。
  • B_intra = 150 GB/s(NVLink)および B_inter = 12.5 GB/s(100GbE)の場合、B_intra/B_inter の比は 12 に達し、2.3 の閾値を大幅に上回るため、テンソルサイズにかかわらず一貫した性能向上が得られる。
  • エンドツーエンド遅延の低減と安定したフロー制御のおかげで、特に高遅延または高 GPU 数のシナリオにおいて、大規模シミュレーションでも優れたスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。