Skip to main content
QUICK REVIEW

[論文レビュー] LazyPIM: Efficient Support for Cache Coherence in Processing-in-Memory Architectures

Amirali Boroumand, Saugata Ghose|arXiv (Cornell University)|Jun 10, 2017
Parallel Computing and Optimization Techniques参考文献 14被引用数 17
ひとこと要約

LazyPIM は、処理内メモリ(PIM)アーキテクチャ向けに、コherenCeチェックをカーネル完了までバッチ処理することで、オフチップトラフィックを削減する、予測的で署名ベースのキャッシュ整合性メカニズムを提案する。衝突を検出するために圧縮された整合性署名を使用し、必要に応じてのみロールバックすることで、従来の手法と比較して平均性能を 19.6% 向上させ、オフチップトラフィックを 30.9% 減少させ、エネルギー消費を 18.0% 削減した。

ABSTRACT

Processing-in-memory (PIM) architectures have seen an increase in popularity recently, as the high internal bandwidth available within 3D-stacked memory provides greater incentive to move some computation into the logic layer of the memory. To maintain program correctness, the portions of a program that are executed in memory must remain coherent with the portions of the program that continue to execute within the processor. Unfortunately, PIM architectures cannot use traditional approaches to cache coherence due to the high off-chip traffic consumed by coherence messages, which, as we illustrate in this work, can undo the benefits of PIM execution for many data-intensive applications. We propose LazyPIM, a new hardware cache coherence mechanism designed specifically for PIM. Prior approaches for coherence in PIM are ill-suited to applications that share a large amount of data between the processor and the PIM logic. LazyPIM uses a combination of speculative cache coherence and compressed coherence signatures to greatly reduce the overhead of keeping PIM coherent with the processor, even when a large amount of sharing exists.We find that LazyPIM improves average performance across a range of data-intensive PIM applications by 19.6%, reduces off-chip traffic by 30.9%, and reduces energy consumption by 18.0%, over the best prior approaches to PIM coherence.

研究の動機と目的

  • PIM アーキテクチャにおける従来のキャッシュ整合性プロトコルが引き起こす高いオフチップトラフィックが、PIM の性能向上効果を損なうのを是正すること。
  • プロセッサと PIM コア間で高いデータ共有が生じるデータ集約的ワークロード向けに、効率的でスケーラブルなキャッシュ整合性を実現すること。
  • 整合性関連の通信を最小限に抑える一方で、従来のマルチスレッドプログラミングモデルとの互換性を維持すること。
  • 正しさや性能を損なうことなく、PIM システムにおけるエネルギー消費とオフチップ帯域幅の使用量を削減すること。

提案手法

  • LazyPIM は予測実行を採用し、PIM コアが即座に整合性リクエストを送信せずに、整合性権限を仮定する。
  • カーネル実行中、PIM キャッシュにすべてのデータ更新を予測的に保持する。
  • カーネル完了後、PIM コアはプロセッサに圧縮された整合性署名を送信し、衝突をチェックする。
  • プロセッサは署名を用いて、PIM カーネルが読み取り後、プロセッサがデータを変更したかどうかを検出する。
  • 衝突が検出された場合、プロセッサは dirty ラインをフラッシュし、PIM カーネルを再実行する。
  • 圧縮署名(例:2K–8K ビット)の使用により、誤検出を低減し、オフチップトラフィックを最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1予測的でバッチ処理された整合性メカニズムは、正しさを損なわず、PIM アーキテクチャにおけるオフチップトラフィックを削減できるか?
  • RQ2圧縮された整合性署名に基づく衝突検出は、誤検出とロールバックを最小限に抑えるのにどの程度効果的か?
  • RQ3高いデータ共有が生じるデータ集約的 PIM ワークロードにおいて、予測的整合性は性能とエネルギー効率をどの程度維持できるか?
  • RQ4署名サイズの選択が、衝突検出の正確性とオフチップ通信オーバーヘッドのトレードオフにどのように影響するか?

主な発見

  • LazyPIM は、データ集約的 PIM アプリケーション全体で、最良の従来手法と比較して平均性能を 19.6% 向上させた。
  • 整合性チェックをバッチ処理し、リアルタイムの整合性メッセージ交換を最小限に抑えることで、オフチップトラフィックを 30.9% 減少させた。
  • 通信オーバーヘッドの低減と再実行回数の削減により、エネルギー消費は 18.0% 削減された。
  • 8K ビット署名を使用すると、平均で衝突率が 30% 減少するが、オフチップトラフィックが 30–33% 増加するため、2K ビット署名の方が全体として効率的である。
  • 2K ビット署名構成は、評価されたすべてのワークロードで、性能と通信コストの最良のバランスを達成した。
  • LazyPIM は、従来のマルチスレッドプログラミングモデルを維持したまま、正しく高速な PIM 実行を可能にした。これは、制限的なプログラミングモデルを必要とする従来の手法とは対照的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。