Skip to main content
QUICK REVIEW

[論文レビュー] COMET: A Comprehensive Cluster Design Methodology for Distributed Deep Learning Training

Divya Kiran Kadiyala, Saeed Rashidi|arXiv (Cornell University)|Nov 30, 2022
Advanced Data Processing Techniques被引用数 5
ひとこと要約

COMETは、分散ディスプレイ学習トレーニングクラスタの迅速な設計空間探索を可能にする包括的でワークフロー型の手法であり、並列化戦略(データ並列/モデル並列)とクラスタリソースのプロビジョニング(計算、メモリ、ネットワーク)を共同で最適化する。システム設計者は、DojoクラスタにおけるMP8_DP8やTPUクラスタにおけるメモリ拡張の必要性といった最適な構成を特定でき、ベースライン設定に対して最大3.1倍の高速化を達成する。

ABSTRACT

Modern Deep Learning (DL) models have grown to sizes requiring massive clusters of specialized, high-end nodes to train. Designing such clusters to maximize both performance and utilization--to amortize their steep cost--is a challenging task requiring careful balance of compute, memory, and network resources. Moreover, a plethora of each model's tuning knobs drastically affect the performance, with optimal values often depending on the underlying cluster's characteristics, which necessitates a complex cluster-workload co-design process. To facilitate the design space exploration of such massive DL training clusters, we introduce COMET, a holistic cluster design methodology and workflow to jointly study the impact of parallelization strategies and key cluster resource provisioning on the performance of distributed DL training. We develop a step-by-step process to establish a reusable and flexible methodology, and demonstrate its application with case studies of training large models on cluster configurations of variable compute, memory, and network resources. Our case studies demonstrate COMET's utility in identifying promising architectural optimization directions and guiding system designers in configuring key model and cluster parameters. To illustrate, cluster configuration comparisons identify performance differences of up to 7.7x and highlight performance optimization opportunities of up to 1.4x when employing memory expansion as an optimization technique.

研究の動機と目的

  • パフォーマンスと利用度を最大化する高コストで大規模な分散ディスプレイ学習クラスタの設計課題に対処する。
  • 計算、メモリ、ネットワークのハードウェア特性と併せてモデル並列化戦略を共同設計する複雑さを克服する。
  • 並列化度とクラスタリソース構成の広大な設計空間を迅速に探索可能にする。
  • CXLベースのメモリ階層といった新技術の影響を踏まえた、システムアーキテクト向けの実行可能なインサイトを提供する。
  • ディスプレイ学習エンジニアが最適なトレーニング戦略を選択できるようにし、クラスタ設計者がリソースを効率的にプロビジョニングできるようにする。

提案手法

  • Transformer-1Tなどの大規模モデルを層に分解し、異なる並列化戦略下でのトレーニング動作を分析する。
  • ピーク性能、メモリ容量、メモリ帯域幅、オンチップSRAM、ネットワーク帯域幅といった主要なシステムパラメータを用いてクラスタワークロードをモデル化する。
  • データ並列化(DP)とモデル並列化(MP)の異なる度合いにおけるトレーニングパフォーマンスとメモリ要件を評価するための段階的ワークフローを実装する。
  • TPU v4、Dojo D1などの異なるクラスタ構成間での正規化された実行時間比較を用い、パフォーマンスボトルネックと最適構成を同定する。
  • 集約通信パターン(例:論理的リング)とネットワークトポロジ(3Dトーラス、シングルレベルスイッチ)をシミュレートし、通信オーバーヘッドを評価する。
  • メモリ拡張技術(例:1.6倍の容量増加)を統合し、トレーニングパフォーマンスとメモリ内トレーニングの実現可能性に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1異なる度合いのデータ並列化とモデル並列化は、多様なクラスタアーキテクチャ上でのトレーニングパフォーマンスとメモリ利用度にどのように影響するか?
  • RQ21兆パラメータのTransformerモデルを効率的にトレーニングするための、計算、メモリ、ネットワークリソースの最適なバランスは何か?
  • RQ3ノードあたりのメモリ容量が限られているクラスタにおいて、メモリ拡張技術(例:容量の増加)がトレーニングパフォーマンスに顕著に改善をもたらすのはどのような構成か?
  • RQ43Dトーラスとシングルスイッチの異なるクラスタトポロジとネットワーク帯域幅は、通信オーバーヘッドと全体のトレーニング時間にどのように影響するか?
  • RQ5CXLベースの階層構造といった新技術は、大規模分散トレーニングにおいてどの程度パフォーマンスを向上させるか?

主な発見

  • DojoクラスタはMP8_DP8を採用することで、DGX A100ベースラインに対して3.1倍の高速化を達成し、最良のDGX設定をも上回る性能を発揮する。
  • TPU v4クラスタでは、バスタブ曲線に類似したパフォーマンス曲線のため、最適な構成はMP4_DP1024であるが、ノードあたりのメモリ容量が限界に近いため、MP256_DP16を超えると著しくパフォーマンスが低下する。
  • TPUクラスタでノードあたりのメモリ容量を1.6倍に増加させると、MP64_DP64トレーニングが可能となり、これはMP256_DP16よりも3倍速くなる。これにより、メモリ拡張の大きな効果が明らかになる。
  • Dojoクラスタでは、DP度の増加に伴いトレーニング時間がバスタブ曲線を示さない。これは、高いピーク性能と大容量のオンチップSRAMのおかげで、計算負荷の増加に対してもパフォーマンスにペナルティが発生しないためである。
  • ノードあたりのメモリ容量が限られているクラスタでは、メモリ容量が深刻なボトルネックとなる。これにより、より高い並列化度を実現し、通信オーバーヘッドを低減するためのメモリ拡張が不可欠となる。
  • この手法により、メモリ容量が不足している場合、通信パターンがトレーニング時間の主要因となり、特に高頻度のノード間通信を伴うモデル並列領域で顕著に顕在することが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。