Skip to main content
QUICK REVIEW

[論文レビュー] UVMBench: A Comprehensive Benchmark Suite for Researching Unified Virtual Memory in GPUs

Yongbin Gu, Wenxuan Wu|arXiv (Cornell University)|Jul 20, 2020
Parallel Computing and Optimization Techniques参考文献 19被引用数 8
ひとこと要約

本論文では、統合仮想メモリ(UVM)のパフォーマンスを、さまざまなメモリアクセスパターンにおいて評価することを目的とした、32の多様なGPUアプリケーションから構成される包括的なベンチマークスイート、UVMBenchを紹介する。このスイートにより、UVMのオーバーヘッドを体系的に分析でき、ページスラッシングや非効率な除外ポリシーに起因するメモリ過小利用下での顕著なパフォーマンス低下が明らかになった。これにより、UVMに配慮した最適化技術の必要性が強調された。

ABSTRACT

The recent introduction of Unified Virtual Memory (UVM) in GPUs offers a new programming model that allows GPUs and CPUs to share the same virtual memory space, which shifts the complex memory management from programmers to GPU driver/ hardware and enables kernel execution even when memory is oversubscribed. Meanwhile, UVM may also incur considerable performance overhead due to tracking and data migration along with special handling of page faults and page table walk. As UVM is attracting significant attention from the research community to develop innovative solutions to these problems, in this paper, we propose a comprehensive UVM benchmark suite named UVMBench to facilitate future research on this important topic. The proposed UVMBench consists of 32 representative benchmarks from a wide range of application domains. The suite also features unified programming implementation and diverse memory access patterns across benchmarks, thus allowing thorough evaluation and comparison with current state-of-the-art. A set of experiments have been conducted on real GPUs to verify and analyze the benchmark suite behaviors under various scenarios.

研究の動機と目的

  • GPUにおける統合仮想メモリ(UVM)を評価するための標準的で代表的なベンチマークの不足に対処すること。
  • 多様なアプリケーション分野およびメモリアクセスパターンにおいて、UVM最適化の徹底的で比較可能な評価を可能にすること。
  • 特にメモリ過小利用下における現在のUVMシステムのパフォーマンスボトルネックを同定すること。
  • 一貫した実装を備えた統一的で生産環境向けのベンチマークスイートを提供することで、今後の研究を支援すること。
  • ハードウェアプリファッチャーとメモリアクセスパターンがUVMにおけるPCIe帯域幅利用に与える影響を分析すること。

提案手法

  • 著者らは、機械学習、線形代数、グラフアルゴリズム、および物理シミュレーションなど多様な分野から32の代表的なGPUカーネルを選定した。
  • すべてのベンチマークは、一貫した評価と比較を保証するため、統一されたプログラミングインターフェースで実装された。
  • スティーミング、ランダム、再利用集中的なさまざまなメモリアクセスパターンが、異なるカーネル設定およびスレッドブロックを介して含まれている。
  • 実際のGPUを用いた実験により、有効なPCIe帯域幅、メモリアクセス遅延、およびメモリ過小利用下でのパフォーマンスを測定した。
  • メモリ過小利用は、cudaMallocを用いて利用可能なGPUメモリを必要メモリの110%および125%に制限することでエミュレートされた。
  • ページフォールト頻度、データ移行量、およびハードウェアプリファッチャーがUVMパフォーマンスに与える役割が分析された。

実験結果

リサーチクエスチョン

  • RQ1異なるメモリアクセスパターンは、UVMパフォーマンスおよびPCIe帯域幅利用にどのように影響を与えるか?
  • RQ2メモリ過小利用は、UVMカーネル実行パフォーマンスにどのような影響を与えるか?
  • RQ3なぜ一部のベンチマークはUVM下で深刻なパフォーマンス劣化を示すのに対し、他のベンチマークは僅かな遅延にとどまるのか?
  • RQ4現在のハードウェアプリファッチャーは、UVMパフォーマンスオーバーヘッドを軽減するためにどの程度効果的か?
  • RQ5現在の除外ポリシーが、UVMにおけるページスラッシングにどの程度寄与しているか?

主な発見

  • メモリ過小利用下では、多くのベンチマークがページ除外中のカーネルスタールに起因して2〜3倍の遅延を示す。特にスティーミングアクセスパターンで顕著である。
  • 一部のベンチマークでは、短いデータ再利用距離に起因する深刻なページスラッシングにより、100倍を超えるパフォーマンス劣化が発生した。
  • UVMにおける有効なPCIe帯域幅はベンチマークごとに顕著に異なる。一部のベンチマークは高い利用度を示すが、他のベンチマークは小さなデータ移行サイズのため利用度が低いままだった。
  • 現代GPUに内蔵されたハードウェアプリファッチャーは、PCIe帯域幅を十分に活用できていないことが判明し、UVMに配慮したプリファッチング技術の開発が求められる。
  • 現在のLRU除外ポリシーは、再利用集中的なワークロードにおいて、頻繁で不必要なページ移行を引き起こし、パフォーマンスを著しく低下させる。
  • 標準化されたベンチマークの欠如が、UVM最適化技術の公平な比較を阻害しており、UVMBenchのような統一的で評価可能なベンチマークスイートの必要性が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。