Skip to main content
QUICK REVIEW

[論文レビュー] Moving Processing to Data: On the Influence of Processing in Memory on Data Management

Tobias Vinçon, Andreas Koch|arXiv (Cornell University)|May 12, 2019
Parallel Computing and Optimization Techniques参考文献 95被引用数 4
ひとこと要約

この論文は、3次元積層DRAMと埋め込みプロセッシングユニットを活用して、メモリ内またはその周辺で計算処理を直接実行することにより、データ移動を低減するプロセッシング・イン・メモリ(PIM)をパラダイムとして調査する。PIMは、グラフ処理、ニューラルネットワーク、分析クエリなど、データ集約的ワークロードにおいて、CPUおよびメモリ帯域幅のボトルネックを最小限に抑えることで、性能、スケーラビリティ、エネルギー効率を顕著に向上させることを示している。

ABSTRACT

Near-Data Processing refers to an architectural hardware and software paradigm, based on the co-location of storage and compute units. Ideally, it will allow to execute application-defined data- or compute-intensive operations in-situ, i.e. within (or close to) the physical data storage. Thus, Near-Data Processing seeks to minimize expensive data movement, improving performance, scalability, and resource-efficiency. Processing-in-Memory is a sub-class of Near-Data processing that targets data processing directly within memory (DRAM) chips. The effective use of Near-Data Processing mandates new architectures, algorithms, interfaces, and development toolchains.

研究の動機と目的

  • 現代のデータ集約的ワークロードにおける、ストレージ、メモリ、CPU間の過剰なデータ移動によって引き起こされる性能ボトルネックに対処する。
  • プロセッシング・イン・メモリ(PIM)が、データをメモリに近接して計算を実行することにより、フォン・ノイマンボトルネックを軽減できるかを調査する。
  • 不規則なアクセスパターンと高容量データを伴うデータベースおよび分析ワークロードにおいて、PIMがスケーラビリティとエネルギー効率をどのように向上させられるかを評価する。
  • データ管理システムにおいてPIMをサポートするために必要なアーキテクチャ的およびアルゴリズム的変更を検討する。
  • グラフ処理、ニューラルネットワーク学習、OLAPワークロードなど、PIMが顕著な性能および効率的向上をもたらすと予想されるユースケースを特定し、分析する。

提案手法

  • 従来のデータ・トゥ・コードモデルから、計算がメモリ内またはその周辺で実行されるコード・トゥ・データ、またはイン・サイト処理モデルへの移行を提案する。
  • 3次元積層DRAM(HBM)とストレージデバイス内に統合されたプロセッシングユニット(例:FPGA、CPU)を活用し、高帯域幅かつ低遅延のメモリ内計算を実現する。
  • スパース行列およびグラフ処理に特化したPIMハードウェアアクセラレータ(例:LiM、TESSERACT)を設計し、データの局所性とスパarsityを活用する。
  • データ再配置エンジン(DRE)を導入し、メモリ内データレイアウトを動的に再構成することで、キャッシュ効率の向上とメモリ帯域幅の無駄を削減する。
  • CPUとPIMユニット間での効率的なタスクスケジューリングを可能にするために、OpenCLなどのプログラミングモデルを拡張し、異種PIMシステムをサポートする。
  • 実世界のワークロード(例:PageRank、一般化されたスパース行列乗算、ディープラーニング学習)を用いてシミュレーションと評価を行い、性能およびエネルギー効率の向上を定量的に測定する。

実験結果

リサーチクエスチョン

  • RQ1プロセッシング・イン・メモリは、データ集約的ワークロードにおいてどの程度データ移動を低減し、性能を向上させられるか?
  • RQ2PIMアーキテクチャは、分析的および機械学習ワークロードに一般的に見られる不規則なアクセスパターンと低いデータ局所性をどのように処理するか?
  • RQ3現代のデータベースおよびデータ管理システムにPIMを統合するにあたり、主なアーキテクチャ的およびソフトウェアインターフェース上の課題は何か?
  • RQ4グラフ処理およびニューラルネットワーク学習において、従来のCPUベースの実行と比較して、PIMベースのアクセラレータは顕著な性能およびエネルギー効率の向上を達成できるか?
  • RQ5PIMハードウェアを効果的に活用しつつ、ポータビリティと保守性を維持するため、プログラミングモデルおよび抽象化をどのように拡張できるか?

主な発見

  • PIMベースのシステムは、従来のマルチスレッドCPU実装と比較して、スパース行列同士の乗算において性能およびエネルギー効率に2桁以上(2オーダー以上)の向上を示した。
  • データ再配置エンジン(DRE)は、メモリ内データレイアウトを動的に再構成することで、PageRankなどのグラフ処理ワークロードにおけるメモリ帯域幅の無駄を削減し、キャッシュ効率を向上させた。
  • グラフ処理向けPIMアクセラレータであるTESSERACTは、ユーザー指定のアクセスヒントと効率的なメモリパーティショニングを可能にすることで、高いメモリ帯域幅利用率を達成し、データ移動を削減した。
  • 3次元積層メモリを活用したスケーラブルなニューラルネットワークアクセラレータであるTetrisは、計算の一部をDRAMにオフロードすることでバスの競合を低減し、データフローを改善し、スループットを向上させるとともにエネルギー消費を削減した。
  • PIMをデータ管理システムに統合するには、新しいデータベースオペレータ、パイプラインモデル、およびアトミック性のセマンティクスの導入が必要であるが、これらはまだ十分に発展していないものの、強く有望な兆しなのである。
  • 有望な結果が得られたものの、現在の大多数のPIM研究はワークロード固有であり、一般用途のデータベース操作に対する広範なサポートを欠いているため、データ管理システムにおける標準化されたPIMプリミティブおよびインターフェースの導入が急務である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。