Skip to main content
QUICK REVIEW

[論文レビュー] dMath: A Scalable Linear Algebra and Math Library for Heterogeneous GP-GPU Architectures

Steven Eliuk, Cameron Upright|arXiv (Cornell University)|Apr 5, 2016
Parallel Computing and Optimization Techniques参考文献 34被引用数 6
ひとこと要約

dMath は、GPU-GPU アーキテクチャ向けにスケーラブルで高パフォーマンスな線形代数および数学ライブラリであり、GPU メモリにデータを恒久的に格納することで、CPU-GPU 移動を最小限に抑え、高度なメモリ管理により、MPI と GPU-Direct RDMA を用いたハイブリッドイントラノード/インタラノード並列処理をサポートすることで、効率的な分散ディープラーニングを実現する。dMath は、分散 DNN 学習において、既存のフレームワークを上回る優れた強スケーリングおよび弱スケーリングを達成しており、低レベルの並列処理を抽象化しながらも高い生産性を維持している。

ABSTRACT

A new scalable parallel math library, dMath, is presented in this paper that demonstrates leading scaling when using intranode, or internode, hybrid-parallelism for deep-learning. dMath provides easy-to-use distributed base primitives and a variety of domain-specific algorithms. These include matrix multiplication, convolutions, and others allowing for rapid development of highly scalable applications, including Deep Neural Networks (DNN), whereas previously one was restricted to libraries that provided effective primitives for only a single GPU, like Nvidia cublas and cudnn or DNN primitives from Nervana neon framework. Development of HPC software is difficult, labor-intensive work, requiring a unique skill set. dMath allows a wide range of developers to utilize parallel and distributed hardware easily. One contribution of this approach is that data is stored persistently on the GPU hardware, avoiding costly transfers between host and device. Advanced memory management techniques are utilized, including caching of transferred data and memory reuse through pooling. A key contribution of dMath is that it delivers performance, portability, and productivity to its specific domain of support. It enables algorithm and application programmers to quickly solve problems without managing the significant complexity associated with multi-level parallelism.

研究の動機と目的

  • 異種 GPU-GPU クラスタ上で、低レベルの並列プログラミングの深い専門知識を必要とせずに、高パフォーマンスでスケーラブルなディープラーニングアプリケーションを開発する課題に対処すること。
  • 繰り返し発生する CPU-GPU メモリ転送によるパフォーマンスボトルネックを、データを GPU デバイスメモリに恒久的にキャッシュすることで低減すること。
  • マルチGPUおよび分散コンピューティングの複雑さを抽象化しながら、混合精度演算と効率的なデータ再編成をサポートする、高レベルでユーザーに透明なプログラミングモデルを提供すること。
  • COTS GPU密度の高いクラスタ上で、MPI と CUDA のハイブリッド並列処理を用いて、分散ディープニューラルネットワーク学習における強スケーリングおよび弱スケーリングを可能にすること。
  • 高度なメモリ管理、キャッシュ、GPU-Direct RDMA を介した最適化された通信を統合することで、HPC や機械学習ワークロードのパフォーマンスと生産性を向上させること。

提案手法

  • dMath は、被演算子を GPU 上に恒久的に保持するための永続的 GPU メモリストレージを採用しており、繰り返し発生する CPU-GPU データ転送を排除し、遅延を低減している。
  • ユーザーのメインスレッドがバックエンド計算を制御するクライアント・サーバー型モデルを採用しており、操作間でデータが GPU メモリにキャッシュされたまま保持される。
  • オブジェクト指向設計を採用し、複数の精度(単精度、倍精度、半精度)、レイアウト、および計算ターゲット(CPU、GPU、分散)をサポートする抽象的な行列およびベクトルクラスを提供している。
  • DNN のパイプライン段階におけるパフォーマンス最適化を図るため、異なる並列レイアウト間での行列の効率的再マッピングを可能にするデータ再編成およびレプリケーションサービスを提供している。
  • MPI と統合し、GPU-Direct リモート直接メモリアクセス(RDMA)を活用することで、GPU 間通信を高速化し、遅延を低減するとともに帯域幅を向上させている。
  • 混合精度演算および誤差を許容する圧縮をサポートするため、データキャッシュ、メモリプール、効率的な型変換などの高度なメモリ管理技術を含んでいる。

実験結果

リサーチクエスチョン

  • RQ1GPU 密度の高いクラスタ上で、分散ディープラーニングワークロードにおける線形代数ライブラリが、どのように優れた強スケーリングおよび弱スケーリングを達成できるか?
  • RQ2恒久的な GPU メモリストレージと高度なメモリ管理は、大規模な機械学習において、CPU-GPU データ転送のオーバーヘッドをどの程度低減できるか?
  • RQ3ハイブリッド並列処理(MPI + CUDA)の複雑さを効果的に隠蔽できる高レベルの抽象化レイヤーは、分散 DNN 学習においても高いパフォーマンスを維持できるか?
  • RQ4GPU-Direct RDMA は、PCIe を介した従来の MPI と比較して、マルチGPUシステムにおける GPU 間通信パフォーマンスをどのように向上させるか?
  • RQ5データ再編成およびレイアウト変換は、ディープニューラルネットワークパイプラインにおける連続的処理のパフォーマンス最適化において、どのような役割を果たすか?

主な発見

  • dMath は、オープンソースフレームワークと比較して優れた強スケーリングおよび弱スケーリングを示しており、Expresso フレームワークを介した分散 DNN 学習において、実験的にパフォーマンスが向上していることが確認された。
  • データを GPU メモリに恒久的にキャッシュすることで、高価な CPU-GPU 転送を排除し、GEMM のような反復的アルゴリズムにおける遅延を低減することで、顕著なパフォーマンス向上を達成している。
  • OpenMPI および MVAPICH2 と統合された GPU-Direct RDMA により、通信遅延が低減し帯域幅が向上し、効率的なノード内およびノード間 GPU 通信が可能になった。
  • データ再編成およびレプリケーションサービスにより、並列データ配布間での効率的なレイアウト変換が可能となり、DNN パイプライン段階全体のパフォーマンス最適化が実現された。
  • 半精度、単精度、倍精度の混合精度演算を効率的な型変換および誤差を許容する圧縮を用いてサポートしており、適切な数値アルゴリズムでは精度を損なわずにメモリ帯域幅の使用量を削減している。
  • MPI、CUDA、データレイアウト管理の低レベルな詳細を抽象化することで、開発者がシステムレベルの複雑さに煩わされず、アルゴリズム設計に集中できる高生産性を実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。