Skip to main content
QUICK REVIEW

[論文レビュー] TopoOpt: Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs

Weiyang Wang, Moein Khazraee|arXiv (Cornell University)|Feb 1, 2022
Ferroelectric and Negative Capacitance Devices被引用数 16
ひとこと要約

TopoOpt は再構成可能な光ファブリックを用いて、分散 DNN 学習のネットワークトポロジーと並列化戦略を共同最適化し、ワークロードの要件に応じた動的で効率的なトポロジーを実現する。交互最適化と群論にインspiredされたアルゴリズムである TotientPerms を用いて、計算、通信、トポロジーを統合的に最適化することで、同コストの Fat-tree ネットワークと比較して最大 3.4× の高速化を達成した。

ABSTRACT

We propose TopoOpt, a novel direct-connect fabric for deep neural network (DNN) training workloads. TopoOpt co-optimizes the distributed training process across three dimensions: computation, communication, and network topology. We demonstrate the mutability of AllReduce traffic, and leverage this property to construct efficient network topologies for DNN training jobs. TopoOpt then uses an alternating optimization technique and a group theory-inspired algorithm called TotientPerms to find the best network topology and routing plan, together with a parallelization strategy. We build a fully functional 12-node direct-connect prototype with remote direct memory access (RDMA) forwarding at 100 Gbps. Large-scale simulations on real distributed training models show that, compared to similar-cost Fat-Tree interconnects, TopoOpt reduces DNN training time by up to 3.4x.

研究の動機と目的

  • 分散 DNN 学習における Fat-tree トポロジーの増大するボトル neck を解決すること。Fat-tree は予測可能で繰り返し発生する AllReduce やモデル並列通信のトラフィックパターンに不適切である。
  • 従来のデータセンターネットワークが予測不能で一時的なトラフィックを想定しているが、これは現実の DNN 学習ワークロードとは一致しない点を克服すること。
  • 計算、通信、ネットワークトポロジーの 3 次元を共同最適化し、各トレーニングジョブに対して最適な並列化戦略と物理的トポロジーを同時に選択すること。
  • 再構成可能な光スイッチとホストベースの RDMA フォワーディングを活用して、各ジョブごとに専用で効率的なトポロジーを構築するシステムを設計し、パフォーマンスとコスト効率を向上させること。
  • トポロジーに配慮した最適化が、従来のインターコネクトと比較してトレーニングイテレーション時間とコストを顕著に短縮することを実証すること。

提案手法

  • 固定トポロジー下で並列化戦略を最適化する反復的フレームワークを提案し、その後、得られたトラフィック要件に基づいてトポロジーを更新する。
  • AllReduce とモデル並列転送の両方に効率的である Permuation を生成する群論にインspiredされたアルゴリズム TotientPerms を導入し、ホップ数を低減するとともに負荷バランスを改善する。
  • 再構成可能なパッチパネルを備えた直接接続型光ファブリックを用いて、各 DNN 学習ジョブに対して専用で低遅延なパーティションを構築し、動的トポロジー再構成を可能にする。
  • ホストベースの RDMA フォワーディングを NIC ネットワークパーティショニング (NPAR) を用いて実装し、非ローカルトラフィックのフォワーディングを可能にしつつ RDMA の意味論を維持することで、標準 RDMA の主な制限を克服する。
  • TotientPerms を NCCL に統合し、複数のリング AllReduce サブトポロジーにまたがる負荷バランスの取れたパラメータ同期を実現する。
  • 100 Gbps RDMA NIC と Telescent 光パッチパネルを搭載した 12 ノードのプロトタイプを構築し、実世界の環境下でシステムを検証した。

実験結果

リサーチクエスチョン

  • RQ1従来の Fat-tree インターコネクトと比較して、ネットワークトポロジーと並列化戦略を共同最適化することで、DNN 学習時間は顕著に短縮可能か?
  • RQ2AllReduce トラフィックの再構成可能性を活用すれば、AllReduce とモデル並列通信の両方を同時に最適化するトポロジーを設計可能か?
  • RQ3DNN 学習ジョブにおける計算、通信、トポロジーの結合配置の巨大な探索空間を効率的に探索するアルゴリズム的手法は何か?
  • RQ4再構成可能な光インターコネクトは、ジョブ固有のトラフィックパターンに動的に適合することで、コスト効率的かつ高性能な DNN 学習を実現可能か?
  • RQ5非ローカルパケットをフォワードするホストリレーアーキテクチャにおいて、RDMA ベースのフォワーディングを信頼性高く実装するにはどうすればよいか?

主な発見

  • TopoOpt は同コストの Fat-tree インターコネクトと比較して、DNN 学習イテレーション時間を最大 3.4× 短縮し、顕著なパフォーマンス向上を示した。
  • 理想のフル・バイセクション・バンド幅 Fat-tree と比較して平均 3.2× のコスト低減を達成し、優れたコスト効率を示した。
  • DLRM、CANDLE、BERT、NCF、ResNet50、VGG の 6 種類の実際の DNN モデルを用いた大規模シミュレーションにより、多様なアーキテクチャで一貫した性能向上が確認された。
  • TotientPerms は AllReduce に適した効率的な Permuation を提供するとともに、モデル並列転送のホップ数を低減し、全体の通信効率を向上させた。
  • TotientPerms を NCCL に統合することで、複数のリング AllReduce サブトポロジーにまたがる負荷バランスの取れたパラメータ同期が可能になり、スケーラビリティが向上した。
  • 100 Gbps RDMA と光再構成を備えた 12 ノードのプロトタイプは、実際の環境下でシステムの実現可能性とパフォーマンスを成功裏に実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。