Skip to main content
QUICK REVIEW

[論文レビュー] TIMELY: Pushing Data Movements and Interfaces in PIM Accelerators Towards Local and in Time Domain

Weitao Li, Pengfei Xu|arXiv (Cornell University)|May 3, 2020
Advanced Memory and Neural Computing参考文献 77被引用数 8
ひとこと要約

TIMELYは、データローカリティを活用するアナログローカルバッファ(ALB)、D/AおよびA/D変換のエネルギーを削減するためのタイムドメインインターフェース(TDI)、入力データを一度だけ読み込むO2IRマッピング手法を採用した、ReRAMベースのPIMアクセラレータを提案する。これにより、入力アクセス回数を最小限に抑え、エネルギー効率を向上させる。PRIMEと比較して、計算密度は最大31.2倍、スループットは736.6倍向上し、最新のR2PIMアクセラレータと比較してエネルギー効率が10倍向上する。

ABSTRACT

Resistive-random-access-memory (ReRAM) based processing-in-memory (R$^2$PIM) accelerators show promise in bridging the gap between Internet of Thing devices' constrained resources and Convolutional/Deep Neural Networks' (CNNs/DNNs') prohibitive energy cost. Specifically, R$^2$PIM accelerators enhance energy efficiency by eliminating the cost of weight movements and improving the computational density through ReRAM's high density. However, the energy efficiency is still limited by the dominant energy cost of input and partial sum (Psum) movements and the cost of digital-to-analog (D/A) and analog-to-digital (A/D) interfaces. In this work, we identify three energy-saving opportunities in R$^2$PIM accelerators: analog data locality, time-domain interfacing, and input access reduction, and propose an innovative R$^2$PIM accelerator called TIMELY, with three key contributions: (1) TIMELY adopts analog local buffers (ALBs) within ReRAM crossbars to greatly enhance the data locality, minimizing the energy overheads of both input and Psum movements; (2) TIMELY largely reduces the energy of each single D/A (and A/D) conversion and the total number of conversions by using time-domain interfaces (TDIs) and the employed ALBs, respectively; (3) we develop an only-once input read (O$^2$IR) mapping method to further decrease the energy of input accesses and the number of D/A conversions. The evaluation with more than 10 CNN/DNN models and various chip configurations shows that, TIMELY outperforms the baseline R$^2$PIM accelerator, PRIME, by one order of magnitude in energy efficiency while maintaining better computational density (up to 31.2$ imes$) and throughput (up to 736.6$ imes$). Furthermore, comprehensive studies are performed to evaluate the effectiveness of the proposed ALB, TDI, and O$^2$IR innovations in terms of energy savings and area reduction.

研究の動機と目的

  • 入力および部分和(Psum)の移動に伴う高いエネルギーコストが原因で生じるReRAMベースPIMアクセラレータのエネルギー非効率性を是正すること。
  • 既存のPIMアーキテクチャにおけるアナログ-デジタル(ADC)およびデジタル-アナログ(DAC)変換のエネルギー消費のボトルネックを克服すること。
  • リソース制限のあるIoTデバイスにおいても、計算密度とスループットを向上させつつ、低エネルギー消費を維持すること。
  • PIMアクセラレータにおけるデータ移動とインターフェースを、局所的および時間ドメイン最適化に向けた包括的で統合的なアーキテクチャ的ソリューションを構築すること。

提案手法

  • ReRAMクロスバー内にアナログローカルバッファ(ALB)を導入し、中間のPsumおよび入力データをアナログ形式で保持することで、頻繁なデータ移動を削減する。
  • 時間多重信号伝送を用いるタイムドメインインターフェース(TDI)を採用し、アクティブな変換回路の数を最小限に抑えることで、D/AまたはA/D変換あたりのエネルギー消費を削減する。
  • 各入力を一度だけ読み込むようにデータアクセスパターンを再構成する「一度だけ入力読み込み(O2IR)」マッピング手法を設計し、総入力アクセス回数およびD/A変換回数を削減する。
  • ALBとO2IRをTDIと統合することで、オフチップデータ移動を最小限に抑え、インターフェースエネルギーを削減したメモリ内演算を実現する。
  • パイプライン型データフローを備えたマルチサブチップアーキテクチャとしてTIMELYを設計し、スループットを最大化するとともに、チップ間エネルギーオーバーヘッドを最小限に抑える。
  • FFサブアレイ内のサブバッファ(X-subBufsおよびP-subBufs)を用いたハイブリッドメモリ階層を採用し、データを局所化することで、エネルギー集約的なアレイ間移動を削減する。

実験結果

リサーチクエスチョン

  • RQ1ReRAMクロスバー内でのアナログデータローカリティをどのように活用すれば、PIMアクセラレータにおける入力およびPsum移動に起因するエネルギー消費を低減できるか?
  • RQ2タイムドメインインターフェースは、アナログPIMアーキテクチャにおける個々のD/AおよびA/D変換のエネルギーコストをどの程度低減できるか?
  • RQ3O2IRのような新しい入力アクセスマッピング戦略は、R2PIMアクセラレータにおけるD/A変換回数および入力アクセス総数を顕著に削減できるか?
  • RQ4ALB、TDI、O2IRの組み合わせが、実世界のR2PIM設計におけるエネルギー効率、計算密度、スループットに及ぼす総合的影響は何か?
  • RQ5提案手法は、異なるCNN/DNNモデルおよびチップ構成において、エネルギー節約および面積効率の観点からどのようにスケーリングするか?

主な発見

  • TIMELYは、高密度ReRAMとALBを活用することで、ベースラインのPRIMEアクセラレータと比較して最大31.2倍の高い計算密度を達成する。
  • 最適化されたデータフローとメモリアクセスオーバーヘッドの低減により、スループットはPRIMEと比較して最大736.6倍向上する。
  • 入力およびPsum移動エネルギーの削減に起因し、PRIMEと比較してエネルギー効率が10倍(10倍向上)、ISAACと比較して18.2倍向上する。
  • ALBとO2IRの組み合わせにより、PRIMEベースの構成においてバンク内データ移動エネルギーが68%削減され、アーキテクチャレベルでの顕著なエネルギー節約が実証された。
  • TDIは、時間多重信号伝送を可能にすることで、D/A変換あたりのエネルギーを削減し、高い変換レートでも総合的なインターフェースエネルギーを顕著に低減する。
  • サブチップ構成による面積スケーリングはエネルギーにほとんど影響を及ぼさず、スループットに対してもわずかな影響しか与えないことから、TIMELYアーキテクチャのスケーラビリティとロバストネスが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。