Skip to main content
QUICK REVIEW

[論文レビュー] MGSim + MGMark: A Framework for Multi-GPU System Research

Yifan Sun, Trinayan Baruah|arXiv (Cornell University)|Oct 15, 2018
Parallel Computing and Optimization Techniques参考文献 28被引用数 4
ひとこと要約

本論文は、AMDのGCN3 ISAに基づき、サイクル単位の正確さ、モularity、並列処理を備えたマルチGPUシミュレータであるMGSimと、統合メモリおよびGPU間アクセスパターンを対象としたベンチマークスイートであるMGMarkを提案する。4つのCPUコアを用いた場合、関数エミュレーションとアーキテクチャシミュレーションでそれぞれ3.5倍および2.5倍の高速化を達成しながら、実ハードウェアと比較して平均94.5%の正確さを維持しており、マルチGPUシステム設計のスケーラブルかつ正確な評価を可能にする。

ABSTRACT

The rapidly growing popularity and scale of data-parallel workloads demand a corresponding increase in raw computational power of GPUs (Graphics Processing Units). As single-GPU systems struggle to satisfy the performance demands, multi-GPU systems have begun to dominate the high-performance computing world. The advent of such systems raises a number of design challenges, including the GPU microarchitecture, multi-GPU interconnect fabrics, runtime libraries and associated programming models. The research community currently lacks a publically available and comprehensive multi-GPU simulation framework and benchmark suite to evaluate multi-GPU system design solutions. In this work, we present MGSim, a cycle-accurate, extensively validated, multi-GPU simulator, based on AMD's Graphics Core Next 3 (GCN3) instruction set architecture. We complement MGSim with MGMark, a suite of multi-GPU workloads that explores multi-GPU collaborative execution patterns. Our simulator is scalable and comes with in-built support for multi-threaded execution to enable fast and efficient simulations. In terms of performance accuracy, MGSim differs $5.5\%$ on average when compared against actual GPU hardware. We also achieve a $3.5 imes$ and a $2.5 imes$ average speedup in function emulation and architectural simulation with 4 CPU cores, while delivering the same accuracy as the serial simulation. We illustrate the novel simulation capabilities provided by our simulator through a case study exploring programming models based on a unified multi-GPU system (U-MGPU) and a discrete multi-GPU system (D-MGPU) that both utilize unified memory space and cross-GPU memory access. We evaluate the design implications from our case study, suggesting that D-MGPU is an attractive programming model for future multi-GPU systems.

研究の動機と目的

  • システムレベルの研究を対象とした、公開可能でスケーラブルかつ正確なマルチGPUシミュレーションフレームワークの不足を解消すること。
  • 特にメモリ管理、インターコネクト、ランタイムシステムに焦点を当てた、マルチGPUシステムの詳細なマイクロアーキテクチャ的分析を可能にすること。
  • 統合メモリを備えた、統合型対比離散型マルチGPUシステムを含む、新興プログラミングモデルの評価を可能にすること。
  • 並列実行と正確なタイミングモデリングをサポートする、モジュラーで拡張可能で高性能なシミュレーションインfraを提供すること。
  • 実際のマルチGPU協働実行パターンを捉える包括的なベンチマークスイート(MGMark)を提供すること。

提案手法

  • MGSimは、AMDのGCN3命令セットアーキテクチャに基づき、マルチGPUシステムの完全なアーキテクチャモデリングを可能にするサイクル単位の正確な実行駆動型シミュレータである。
  • シミュレータは、拡張性を高め、コードベースの結合を低減するために、強力な状態カプセル化を実現したモジュラーでコンポーネントベースの設計を採用している。
  • MGSimは、精度を損なわずにスケーラブルな高速化を実現する新規な並列化戦略を採用しており、4つのCPUコアを用いた場合に3.5倍および2.5倍の高速化を達成している。
  • MGMarkは、データおよびカーネルマッピング、GPU間のメモリアクセス、同期処理を含む、多様なマルチGPU実行パターンを捉えるベンチマークスイートである。
  • このフレームワークは、統合メモリ空間およびGPU間メモリアクセスをサポートしており、現代のGPUプログラミングモデルの現実的なモデリングを可能にしている。
  • MGSimは、マイクロベンチマークおよびフルアプリケーションを用いて実GPUハードウェアと検証されており、平均94.5%(5.5%の偏差)の正確さを達成している。

実験結果

リサーチクエスチョン

  • RQ1高いパフォーマンスとモularityを備えたサイクル単位の正確なマルチGPUシミュレータが、新興GPUシステム設計に関する研究をどのようにより効果的に可能にするか?
  • RQ2統合メモリおよびGPU間アクセスを前提とした場合、離散型マルチGPU(D-MGPU)と統合型マルチGPU(U-MGPU)システムの間で、パフォーマンスとスケーラビリティのトレードオフはどのようなものか?
  • RQ3メモリアクセスパターンとGPU間通信は、マルチGPUワークロード全体のシステムパフォーマンスにどのように影響を与えるか?
  • RQ4並列シミュレーション技術は、正確さを維持しつつ、どのようにしてシミュレーションスループットを顕著に向上させることができるか?
  • RQ5マルチGPU環境において、プログラマーに低レベルのGPU制御を公開することによって生じるアーキテクチャ的インプリケーションは何か?

主な発見

  • MGSimは、実GPUハードウェアと比較して平均94.5%の正確さを達成しており、テストされたワークロード全体で平均5.5%の偏差を示している。
  • 4つのCPUコアを用いた場合、関数エミュレーションで3.5倍、アーキテクチャシミュレーションで2.5倍の高速化が達成されており、正確さを損なわない。
  • 事例研究では、統合メモリを用いた場合、D-MGPUシステムがU-MGPUシステムに比べてGPU間トラフィックとインターコネクト効率の点で優れていることが示された。
  • プログラマーに真のマルチGPUインタフェースを公開することで、より良いパフォーマンス制御が可能になるが、過剰なGPU間トラフィックを避けるために、データおよびカーネルマッピングに注意を払う必要がある。
  • MGSimのモジュラーかつ合成可能な設計により、効率的なシステム変更とコミュニティ貢献が可能となり、モノリシックシミュレータの制限を克服した。
  • MGMarkは、データローカリティ、負荷分散、同期処理を含む多様なマルチGPU実行パターンを効果的に捉えており、現代のマルチGPUワークロードの評価に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。