Skip to main content
QUICK REVIEW

[論文レビュー] Understanding the Interactions of Workloads and DRAM Types: A Comprehensive Experimental Study

Saugata Ghose, Tianshi Li|arXiv (Cornell University)|Feb 20, 2019
Parallel Computing and Optimization Techniques参考文献 141被引用数 7
ひとこと要約

本論文は、9種類のDRAMタイプにわたる115の現代ワークロードについて包括的な実験的調査を実施し、DDR4 や HMC といった新しいDRAM技術が、DDR3 よりも一貫して優れているわけではないことを明らかにした。これは、高い遅延と局所性の悪用が原因である。研究では、性能上のトレードオフを特定し、ワークロード-DRAMの相互作用に基づいた、特定のハードウェアおよびソフトウェア最適化を提言している。

ABSTRACT

It has become increasingly difficult to understand the complex interaction between modern applications and main memory, composed of DRAM chips. Manufacturers are now selling and proposing many different types of DRAM, with each DRAM type catering to different needs (e.g., high throughput, low power, high memory density). At the same time, the memory access patterns of prevalent and emerging workloads are rapidly diverging, as these applications manipulate larger data sets in very different ways. As a result, the combined DRAM-workload behavior is often difficult to intuitively determine today, which can hinder memory optimizations in both hardware and software. In this work, we identify important families of workloads, as well as prevalent types of DRAM chips, and rigorously analyze the combined DRAM--workload behavior. To this end, we perform a comprehensive experimental study of the interaction between nine different DRAM types and 115 modern applications and multiprogrammed workloads. We draw 12 key observations from our characterization, enabled in part by our development of new metrics that take into account contention between memory requests due to hardware design. Notably, we find that (1) newer DRAM types such as DDR4 and HMC often do not outperform older types such as DDR3, due to higher access latencies and, in the case of HMC, poor exploitation of locality; (2) there is no single DRAM type that can cater to all components of a heterogeneous system (e.g., GDDR5 significantly outperforms other memories for multimedia acceleration, while HMC significantly outperforms other memories for network acceleration); and (3) there is still a strong need to lower DRAM latency, but unfortunately the current design trend of commodity DRAM is toward higher latencies to obtain other benefits. We hope that the trends we identify can drive optimizations in both hardware and software design.

研究の動機と目的

  • 現代のワークロードと多様なDRAMタイプの複雑な相互作用を理解すること。これは、性能、消費電力、密度の面でますます多様化しているためである。
  • ハイブリッドワークロードに対して最適なDRAMタイプを選定する課題に対処すること。現在の設計トレンドは、他の利点を得るために高い遅延を採用している。
  • メモリアクセスパターン、遅延、帯域幅、消費電力の相互作用が、異なるDRAM技術においてどのように現れるかを、実証的洞察を提供すること。
  • 孤立したワークロードやDRAMタイプに焦点を当てた、既存のメモリシミュレーターやベンチマーキング手法の限界を特定すること。
  • 改良済みのシミュレータと包括的なベンチマークスイートの公開を通じて、今後のハードウェアおよびソフトウェア最適化を支援すること。

提案手法

  • DDR3、DDR4、GDDR5、HBM、HMC およびその他の9種類のDRAMタイプをモデル化する、サイクル正確で大幅に改造されたDRAMシミュレータを用いた大規模な実験的調査を実施した。
  • ハイパフォーマンスコンピューティング、クラウド、マルチメディア、ネットワーキング、科学的アプリケーションをカバーする115の実世界および合成ワークロードを評価した。
  • 特にマルチプログラミングワークロード下でのハードウェアの競合やメモリコントローラ動作を考慮した、新たなパフォーマンスメトリクスを開発した。
  • すべてのワークロード-DRAMペアにおいて、アクセス遅延、帯域幅、消費電力、ローバッファーヒットレート、バンクレベルの並列性といった主要なメトリクスを測定した。
  • キャッシュラインのインタリーブと現実的なメモリコントローラポリシーを用いて、結果が実システムの挙動を反映していることを保証した。
  • 複数のワークロードを同時に実行することで、並列実行アプリケーション間の競合やリソース共有の影響を評価した。

実験結果

リサーチクエスチョン

  • RQ1異なるDRAMタイプは、遅延、帯域幅、エネルギー効率の観点から、多様な現代ワークロードにおいてどのように性能を発揮するか?
  • RQ2DDR4 や HMC といった新しいDRAM技術は、DDR3 よりも顕著に優れているのか。特に、アクセスパターンが異なる状況下でどうか?
  • RQ3マルチメディア、ネットワーク処理、HPCワークロードといった特定のワークロードカテゴリに対して最適なDRAMタイプは何か?
  • RQ4メモリアクセスパターン(例:空間的・時間的局所性)は、バンク並列性やローバッファ動作といったDRAMハードウェア機能とどのように相互作用するか?
  • RQ5現在の商用DRAM設計における主なパフォーマンスボトルネックは何か。また、これらはワークロードによってどのように変化するか?

主な発見

  • DDR4 や HMC といった新しいDRAM技術は、高いアクセス遅延と、HMC の場合には空間的・時間的局所性の悪用が原因で、DDR3 よりも一貫して優れているわけではない。
  • GDDR5 はマルチメディア加速ワークロードにおいて、他のDRAMタイプを顕著に上回り、高帯域幅かつ不規則なアクセスパターンに適していることが示された。
  • HMC はネットワーク加速ワークロードにおいて優れたパフォーマンスを発揮するが、バンクレベルの並列性が限定的で、特定のアクセスパターンでは高い遅延が発生するため、他の分野では性能が劣る。
  • すべてのワークロードカテゴリで最適なパフォーマンスを発揮する単一のDRAMタイプは存在せず、これにより異種メモリシステムの必要性が裏付けられた。
  • 帯域幅と密度の向上にもかかわらず、現在の商用DRAM設計のトレンドは、遅延の増加に向かっており、パフォーマンス向上の恩恵を損なう要因となっており、さらなる遅延低減の必要性が浮き彫りになった。
  • 本研究では、ローバッファの局所性とバンクレベルの並列性がDRAMパフォーマンスにおいて極めて重要な要因であることが明らかになった。同じDRAMタイプであっても、ワークロードのアクセスパターンによってパフォーマンスに顕著な差が生じることが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。