Skip to main content
QUICK REVIEW

[論文レビュー] 3D-aCortex: An Ultra-Compact Energy-Efficient Neurocomputing Platform Based on Commercial 3D-NAND Flash Memories

Mohammad Bavandpour, Shubham Sahay|arXiv (Cornell University)|Aug 7, 2019
Advanced Memory and Neural Computing被引用数 5
ひとこと要約

本稿では、時間領域符号化によるベクトル-行列乗算(VMM)を用いて、構造的変更なしに商用3D-NANDフラッシュメモリブロックを活用した、超コンactでエネルギー効率に優れた神経モルフィック推論プロセッサ、3D-aCortexを提案する。既存の64層3D-NAND技術を用いて、~10 fJ/Opの前例のないエネルギー効率と4.34 MB/mm²の記憶密度を達成し、ピーク性能は70.43 TOps/Jおよび10.66 TOps/sを実現した。

ABSTRACT

The first contribution of this paper is the development of extremely dense, energy-efficient mixed-signal vector-by-matrix-multiplication (VMM) circuits based on the existing 3D-NAND flash memory blocks, without any need for their modification. Such compatibility is achieved using time-domain-encoded VMM design. Our detailed simulations have shown that, for example, the 5-bit VMM of 200-element vectors, using the commercially available 64-layer gate-all-around macaroni-type 3D-NAND memory blocks designed in the 55-nm technology node, may provide an unprecedented area efficiency of 0.14 um2/byte and energy efficiency of ~10 fJ/Op, including the input/output and other peripheral circuitry overheads. Our second major contribution is the development of 3D-aCortex, a multi-purpose neuromorphic inference processor that utilizes the proposed 3D-VMM blocks as its core processing units. We have performed rigorous performance simulations of such a processor on both circuit and system levels, taking into account non-idealities such as drain-induced barrier lowering, capacitive coupling, charge injection, parasitics, process variations, and noise. Our modeling of the 3D-aCortex performing several state-of-the-art neuromorphic-network benchmarks has shown that it may provide the record-breaking storage efficiency of 4.34 MB/mm2, the peak energy efficiency of 70.43 TOps/J, and the computational throughput up to 10.66 TOps/s. The storage efficiency can be further improved seven-fold by aggressively sharing VMM peripheral circuits at the cost of slight decrease in energy efficiency and throughput.

研究の動機と目的

  • 既存の商用3D-NANDフラッシュメモリを用いて、ハードウェアの変更なしに、極めてエネルギー効率が高くコンパクトなニューロコンピューティングプラットフォームを設計すること。
  • 3D-NANDフラッシュブロックにおける時間領域符号化を用いて、ベクトル-行列乗算(VMM)の面積およびエネルギー効率を極限まで高めること。
  • 非理想デバイス効果を考慮しながら、高スループットおよび高記憶密度を実現可能な多目的ニューロモルフィック推論プロセッサ、3D-aCortexを開発すること。
  • プロセス変動、ノイズ、寄生効果などの現実的な非理想要因を想定したシステムレベルの性能を評価すること。
  • コンパクトでスケーラブルなニューロモルフィックアーキテクチャにおいて、記録的なエネルギー効率と記憶密度を実現すること。

提案手法

  • 時間領域符号化によるVMMを用いて、構造的変更なしに既存の3D-NANDフラッシュメモリブロックでミックスシグナル計算を実現する。
  • 64層ゲートアラウンド型マカロニ型3D-NANDフラッシュブロック(55-nmプロセスノードでプロトタイピング)を用いてVMM回路を実装する。
  • ドレイン誘導障壁低下、容量結合、電荷注入、プロセス変動などの非理想デバイス効果を、回路レベルおよびシステムレベルでモデル化・シミュレーションする。
  • 3D-VMMブロックをコアプロセッシングユニットとして用いたマルチコアニューロモルフィックプロセッサアーキテクチャ、3D-aCortexを設計し、推論ワークロードをサポートする。
  • 周辺回路の共有を検討することで、スループットおよびエネルギー効率のわずかなトレードオフを犠牲にしつつ、記憶効率をさらに向上させる。
  • 複数のベンチマークを対象に包括的なシミュレーションを実施し、性能、エネルギー効率、面積効率を評価する。

実験結果

リサーチクエスチョン

  • RQ1構造的変更なしに、商用3D-NANDフラッシュメモリにインメモリ型ベクトル-行列乗算を効率的に実装できるか?
  • RQ2時間領域符号化VMMを用いた3D-NANDフラッシュにおける、エネルギーおよび面積効率はどの程度達成可能か?
  • RQ3プロセス変動、ノイズ、寄生効果などの現実的な非理想要因を想定した場合、3D-aCortexはどのように性能を発揮するか?
  • RQ43D-NANDベースのニューロモルフィックプロセッサの実現可能な記憶密度と計算スループットはどの程度か?
  • RQ5周辺回路の共有は、コア性能指標を著しく劣化させることなく、記憶効率を顕著に向上させることができるか?

主な発見

  • 提案された3D-VMMは、I/Oおよび周辺回路のオーバーヘッドを含めても、面積効率0.14 µm²/byte、エネルギー効率~10 fJ/Opを達成した。
  • 3D-aCortexは64層3D-NANDフラッシュメモリブロックを用いて、記録的な記憶効率4.34 MB/mm²を達成した。
  • プロセッサはピークエネルギー効率70.43 TOps/Jおよび最大10.66 TOps/sの計算スループットを示した。
  • VMMの周辺回路を積極的に共有することで、記憶効率が最大7倍に向上したが、エネルギー効率およびスループットにわずかな低下が生じた。
  • シミュレーションにより、現実的な非理想条件下で複数の最先端ニューロモルフィックネットワークベンチマークにおいて、頑健な性能が確認された。
  • 本設計は、既存の商用3D-NANDフラッシュ技術と完全に互換性があり、即時のスケーラビリティと統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。