[論文レビュー] Accelerating Bulk Bit-Wise X(N)OR Operation in Processing-in-DRAM Platform
本稿では、アナログDRAMサブアレイ動作を活用した新規二重行アーキテクチャ(DRA)メカニズムを用いて、大量のビット単位XOR演算を高速化する、高スループットな処理内DRAM(PIM)アーキテクチャDRIMを提案する。DRIMは、センスアンプを変更し、同じビットライン上に格納されたオペランド間でのメモリ内演算を可能にすることで、CPUに比べ71倍のスループットとGPUに比べ8.4倍のスループットを達成し、従来のPIMに比べ最大3.7倍の性能向上を実現。DDR4データコピーに比べ69倍のエネルギー削減を実現した。
With Von-Neumann computing architectures struggling to address computationally- and memory-intensive big data analytic task today, Processing-in-Memory (PIM) platforms are gaining growing interests. In this way, processing-in-DRAM architecture has achieved remarkable success by dramatically reducing data transfer energy and latency. However, the performance of such system unavoidably diminishes when dealing with more complex applications seeking bulk bit-wise X(N)OR- or addition operations, despite utilizing maximum internal DRAM bandwidth and in-memory parallelism. In this paper, we develop DRIM platform that harnesses DRAM as computational memory and transforms it into a fundamental processing unit. DRIM uses the analog operation of DRAM sub-arrays and elevates it to implement bit-wise X(N)OR operation between operands stored in the same bit-line, based on a new dual-row activation mechanism with a modest change to peripheral circuits such sense amplifiers. The simulation results show that DRIM achieves on average 71x and 8.4x higher throughput for performing bulk bit-wise X(N)OR-based operations compared with CPU and GPU, respectively. Besides, DRIM outperforms recent processing-in-DRAM platforms with up to 3.7x better performance.
研究の動機と目的
- DNAアライメントや暗号化などのXORおよび加算ベースのワークロードを高速化するための、既存PIMプラットフォームのスループット制限を解消すること。
- 複雑な論理演算に多段階のサイクルと行初期化に依存する従来のPIM設計の非効率性を克服すること。
- アナログ操作を活用して、DRAMサブアレイ内での直接的なビット単位XOR計算を実現し、高スループットかつエネルギー効率の良い演算を可能にすること。
- 商品化されたDRAMと互換性を保ちつつ、最小限の回路変更で面積およびエネルギーオーバーヘッドを最小限に抑えること。
- CPU、GPU、および最先端のPIMアクセラレータ(AmbitやDRISAなど)に比べ、顕著な性能およびエネルギー効率の優位性を実証すること。
提案手法
- 同じDRAMサブアレイ内に格納された異なるワードライン上に配置された2つのオペランド間でビット単位XOR演算を実行できる、二重行アーキテクチャ(DRA)メカニズムを導入すること。
- DRAMサブアレイのアナログ特性を活用し、二重行アーキテクチャ中に制御された電荷共有によってビットライン電圧を操作すること。
- センスアンプを変更し、22本のトランジスタを1つのセンスアンプあたり追加することで、選択的アーキテクチャと電圧比較を可能にすること。
- 最小限の面積コストで新しいアーキテクチャを実現するために、二重接触セル(DCC)を導入し、ワードラインドライバを4:12 MRDに変更(従来の4:16から)。
- 制御ユニット(Ctrl)を用いてアーキテクチャ信号を生成し、メモリコントローラーの事前処理によるページテーブル変換を介した仮想アドレッシングをサポートすること。
- 空間局所性を最大化し、メモリモジュール間のデータ移動を削減するために、メモリレイアウトおよびインタリーブ戦略を最適化すること。
実験結果
リサーチクエスチョン
- RQ1従来のCPUおよびGPUプラットフォームに比べ、PIMアーキテクチャが大量のビット単位XOR演算において顕著に高いスループットを達成できるか?
- RQ2二重行アーキテクチャ(DRA)のような新規なメモリ内演算メカニズムが、多段階サイクルおよび行初期化に依存する従来のPIM設計の制限を克服できるか?
- RQ3信頼性や性能を損なわず、商品化されたDRAMにXOR加速を統合する際の面積およびエネルギーオーバーヘッドはどの程度か?
- RQ4Ambit や DRISA などの既存のPIMプラットフォームに比べ、DRIMはXORベースのワークロードにおいて性能およびエネルギー効率で優位性を示せるか?
- RQ53DスタックドDRAMは、DRIMベースのシステムの性能をどの程度向上できるか?
主な発見
- DRIMは、大量のビット単位XOR演算において、Core-i7 CPUに比べ平均で71倍のスループット、NVIDIA GTX 1080Ti GPUに比べ8.4倍のスループットを達成した。
- Ambit や DRISA-1T1C といった既存のPIMプラットフォームに比べ、XORベースのワークロードにおいて最大3.7倍のスループット向上を実現した。
- DRIMのエネルギー消費は、Ambitに比べ2.4倍低減され、DDR4インターフェースを介したデータコピーに比べ69倍も低減した。
- ビット単位の加算に関しては、Ambitに比べ約2倍、DRISA-1T1Cに比べ1.7倍、CPUに比べ27倍のエネルギー削減を実現した。
- 3DスタックドDRAMを用いたDRIMベースのHMC 2.0は、性能を約13.5倍向上させた。
- DRIMの総面積オーバーヘッドは、DRAMチップ全体の約9.3%と推定され、主にセンスアンプに追加されたトランジスタおよび変更されたワードラインドライバに起因する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。