Skip to main content
QUICK REVIEW

[論文レビュー] RowClone: Accelerating Data Movement and Initialization Using DRAM

Vivek Seshadri, Yoongu Kim|arXiv (Cornell University)|May 7, 2018
Parallel Computing and Optimization Techniques参考文献 68被引用数 12
ひとこと要約

RowCloneは、DRAMの内部アーキテクチャを活用することで、大量データのコピーおよび初期化を低コストで高速化する、in-DRAMメカニズムを提案する。Fast Parallel Mode(同じサブアレイ内での連続アクティブ命令)とPipelined Serial Mode(共有バスを介したバンク間データ転送)を用いることで、従来のCPU駆動転送と比較して、遅延とエネルギー消費を最大2桁低減する。

ABSTRACT

In existing systems, to perform any bulk data movement operation (copy or initialization), the data has to first be read into the on-chip processor, all the way into the L1 cache, and the result of the operation must be written back to main memory. This is despite the fact that these operations do not involve any actual computation. RowClone exploits the organization and operation of commodity DRAM to perform these operations completely inside DRAM using two mechanisms. The first mechanism, Fast Parallel Mode, copies data between two rows inside the same DRAM subarray by issuing back-to-back activate commands to the source and the destination row. The second mechanism, Pipelined Serial Mode, transfers cache lines between two banks using the shared internal bus. RowClone significantly reduces the raw latency and energy consumption of bulk data copy and initialization. This reduction directly translates to improvement in performance and energy efficiency of systems running copy or initialization-intensive workloads

研究の動機と目的

  • 現代のシステムにおけるメモリ帯域幅制限による性能およびエネルギーのボトル neck を解消すること。
  • 特にコピーおよび初期化を含む大容量データ移動処理の高遅延および高エネルギーコストを、CPUからDRAMにオフロードすることで低減すること。
  • DRAMセルアレイの変更なしに、顕著なパフォーマンスおよびエネルギー効率の向上を実現すること。
  • 一般市場向けDRAMの内部構造を活用して、効率的なメモリ内データ移動を実現できることを示すこと。
  • 将来の研究を促進し、新興メモリ技術向けのメモリ内計算およびデータ移動最適化の分野を拡張すること。

提案手法

  • 同じDRAMサブアレイ内の2つのレコード間でのデータコピーを、連続する2つのACTIVATE命令を用いて実現するFast Parallel Mode (FPM) を活用する。
  • 共有内部DRAMバスを介して、異なるバンク間のデータ転送を実現するPipelined Serial Mode (PSM) を採用する。
  • バックトゥバックのACTIVATEをFPM用、パイプラインアクセスをPSM用にサポートするため、既存のDRAM周辺論理を最小限の変更で拡張する。
  • CPUおよびメモリバスの関与を完全に排除し、大容量データのコピーおよび初期化をすべてDRAM内で実行する。
  • レコードバッファおよびサブアレイアーキテクチャを活用して、データ移動処理に高い内部帯域幅を実現する。
  • 低オーバーヘッドなin-DRAM操作を実現するために、一般市場向けDRAMの既存のコマンドインターフェースおよびタイミング制約に依存する。

実験結果

リサーチクエスチョン

  • RQ1CPUおよびメモリバスに依存せず、すべてをDRAM内で実行することで、大容量データのコピーおよび初期化処理を高速化できるか?
  • RQ2DRAMの内部構造を活用して、DRAMセルアレイの変更なしに、高帯域幅かつ低遅延のデータ移動を実現するメカニズムは何か?
  • RQ3最小限のハードウェア変更でDRAMに大容量データ移動をオフロードすることで、どれほどのパフォーマンスおよびエネルギー改善が達成できるか?
  • RQ4RowCloneの原則は、PCM、STT-MRAM、NANDフラッシュなどの他のメモリ技術へも拡張可能か?
  • RQ5どのような広範なクラスのメモリ集約処理が、メモリ内実行によって同様に高速化可能か?

主な発見

  • RowCloneは、従来のCPU駆動方法と比較して、大容量データのコピーおよび初期化処理の遅延を最大2桁低減する。
  • 高速バス転送の排除により、大容量データ移動のエネルギー消費が最大90%削減される。
  • Fast Parallel Modeは、バックトゥバックのACTIVATE命令のみを用いて、同じサブアレイ内のレコード間コピーを最小限のオーバーヘッドで実現する。
  • Pipelined Serial Modeは、共有内部DRAMバスを活用することで、バンク間の効率的なデータ転送を実現し、競合および遅延を低減する。
  • RowCloneのメカニズムは、一般市場向けDRAMと互換性があり、周辺制御論理へのわずかな変更で実装可能である。
  • 本技術は、in-DRAMのビット単位演算、ブール代数、算術演算に関する後続研究を生み出し、より広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。