Skip to main content
QUICK REVIEW

[論文レビュー] High Area/Energy Efficiency RRAM CNN Accelerator with Kernel-Reordering Weight Mapping Scheme Based on Pattern Pruning

Songming Yu, Yongpan Liu|arXiv (Cornell University)|Oct 13, 2020
Advanced Memory and Neural Computing参考文献 20被引用数 4
ひとこと要約

本稿では、パターンプルーニングに基づく新しいカーネル再順序付け重みマッピング方式を用いた、高面積効率かつ高エネルギー効率なRRAMベースのCNNアクセラレータを提案する。パターンプルーニングによる構造的スパarsityを活用し、演算ユニット(OU)機構を活用することで、ベースライン手法と比較して最大5.20倍のクロスバー面積効率、2.15倍のエネルギー効率、1.35倍の性能スループット向上を達成し、精度損失は最小限に抑えられる。

ABSTRACT

Resistive Random Access Memory (RRAM) is an emerging device for processing-in-memory (PIM) architecture to accelerate convolutional neural network (CNN). However, due to the highly coupled crossbar structure in the RRAM array, it is difficult to exploit the sparsity of the network in RRAM-based CNN accelerator. To optimize the weight mapping of sparse network in the RRAM array and achieve high area and energy efficiency, we propose a novel weight mapping scheme and corresponding RRAM-based CNN accelerator architecture based on pattern pruning and Operation Unit(OU) mechanism. Experimental results show that our work can achieve 4.16x-5.20x crossbar area efficiency, 1.98x-2.15x energy efficiency, and 1.15x-1.35x performance speedup in comparison with the traditional weight mapping method.

研究の動機と目的

  • スパースで不規則な構造を持つ重みを処理する際、RRAMベースのCNNアクセラレータにおける低面積効率および低エネルギー効率の課題に対処すること。
  • 精度を損なうことなく、RRAMクロスバー配列においてネットワークのスパarsityを効果的に活用すること。
  • 構造的スパarsityと効率的な計算を両立できる、ハードウェアに配慮した重みマッピング方式を設計すること。
  • パターンプルーニングとOUベースの計算機構を組み合わせることで、高い性能、面積、エネルギー効率を達成すること。

提案手法

  • 1層あたり最大12パターンの構造的でハードウェアにやさしいスパarsityパターンを生成するパターンプルーニングアルゴリズムを導入し、RRAMクロスバーにおける効率的なマッピングを可能にする。
  • 出力チャネルインデックスに基づいて各入力チャネル内のフィルタを再順序付けするカーネル再順序付け重みマッピング方式を開発し、類似したパターンをグループ化してクロスバー利用度を低減する。
  • 細粒度なワードラインおよびビットラインの活性化を可能にする演算ユニット(OU)機構を採用し、非ゼロパターンのみを対象とした選択的計算を実現する。
  • 入力前処理ユニットに全ゼロパターン検出モジュールを統合し、不要なADC/DAC変換をスキップして動的エネルギーを削減する。
  • カーネル出力チャネルの位置とパターン形状のインデックスを保存することで、RRAMにゼロ重みパターンを格納せずに正しいデータルーティングを実現する。
  • 提案されたマッピング方式をサポートする完全なRRAMベースのCNNアクセラレータアーキテクチャを設計し、重みおよび特徴マップの両方のスパarsityを活用する。

実験結果

リサーチクエスチョン

  • RQ1パターンプルーニングから得られる構造的スパarsityは、RRAMクロスバー配列においてどのように効果的に活用され、面積およびエネルギー効率を向上させることができるか?
  • RQ2カーネル再順序付けとOUベースの計算は、スパースなCNN推論におけるクロスバー利用度とエネルギー消費にどのような影響を与えるか?
  • RQ3パターンプルーニングは、RRAMベースのPIMアーキテクチャと互換性を保ちつつ、高いスパarsityを達成し、精度損失を最小限に抑えることができるか?
  • RQ4提案されたマッピング方式は、ナイーブな重みマッピングと比較して、面積、エネルギー、性能効率のどの面でも優れているか?

主な発見

  • 提案されたパターンプルーニングマッピング方式は、ベースライン手法と比較して4.16倍から5.20倍のクロスバー面積効率向上を達成し、RRAMクロスバー面積を76.0%~80.8%まで削減する。
  • CIFAR-10、CIFAR-100、ImageNetの各データセットにおいて、エネルギー効率が1.98倍から2.15倍向上し、ADCエネルギーが主なボトルネックであることが判明した。
  • 1.15倍から1.35倍の性能スループット向上が達成され、主に全ゼロパターンの計算を排除し、メモリアクセスを削減したためである。
  • カーネル再順序付けのインデックスオーバーヘッドは、モデル全体の12.2%(729.5KB~1013.5KB)にとどまり、圧縮モデルサイズと比較して許容可能な水準である。
  • 理論的最適面積効率に非常に近い結果が得られており、CIFAR-10では理論最大値の86.03%に近い値を達成しており、スパarsityの効果的な活用が示された。
  • ImageNetにおける性能は相対的に低いが、これはパターンプルーニングの結果がやや不適切で、スパarsityが低く、パターン数が多くなるため、マッピング効率が低下したためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。