Skip to main content
QUICK REVIEW

[論文レビュー] FORMS: Fine-grained Polarized ReRAM-based In-situ Computation for Mixed-signal DNN Accelerator

Geng Yuan, Payman Behnam|arXiv (Cornell University)|Jun 16, 2021
Advanced Memory and Neural Computing参考文献 76被引用数 9
ひとこと要約

FORMSは、同じサブアレイ内での重みの符号を統一することで、クロスバーサイズを倍増させず、オフセット回路を追加せず、効率的なイン・サイト行列-ベクトル乗算を可能にする、細分化された偏極型ReRAMベースのDNNアクセラレータを提案する。ADMMに基づく重みの偏極化、構造的プルーニング、量子化、ゼロスキップ論理を組み合わせることで、ISAACと比較して最大377.9倍の高速化と1.93倍のエネルギー効率向上を達成し、デバイスのばらつきに対しても精度損失を最小限に抑える。

ABSTRACT

Recent works demonstrated the promise of using resistive random access memory (ReRAM) as an emerging technology to perform inherently parallel analog domain in-situ matrix-vector multiplication -- the intensive and key computation in DNNs. With weights stored in the ReRAM crossbar cells as conductance, when the input vector is applied to word lines, the matrix-vector multiplication results can be generated as the current in bit lines. A key problem is that the weight can be either positive or negative, but the in-situ computation assumes all cells on each crossbar column with the same sign. The current architectures either use two ReRAM crossbars for positive and negative weights, or add an offset to weights so that all values become positive. Neither solution is ideal: they either double the cost of crossbars, or incur extra offset circuity. To better solve this problem, this paper proposes FORMS, a fine-grained ReRAM-based DNN accelerator with polarized weights. Instead of trying to represent the positive/negative weights, our key design principle is to enforce exactly what is assumed in the in-situ computation -- ensuring that all weights in the same column of a crossbar have the same sign. It naturally avoids the cost of an additional crossbar. Such weights can be nicely generated using alternating direction method of multipliers (ADMM) regularized optimization, which can exactly enforce certain patterns in DNN weights. To achieve high accuracy, we propose to use fine-grained sub-array columns, which provide a unique opportunity for input zero-skipping, significantly avoiding unnecessary computations. It also makes the hardware much easier to implement. Putting all together, with the same optimized models, FORMS achieves significant throughput improvement and speed up in frame per second over ISAAC with similar area cost.

研究の動機と目的

  • ReRAMクロスバーにおいて符号付き重みを表現する課題に、ハードウェアコストを倍増させず、オフセット回路を追加せずに対処すること。
  • 細分化されたサブアレイ内で同じ符号の重みを強制することで、アナログドメインにおける効率的なイン・サイト行列-ベクトル乗算を実現すること。
  • アルゴリズムとハードウェアの共同最適化により、ミックスド・シグナルDNNアクセラレータのエネルギー効率と面積効率を向上させること。
  • 細分化されたアーキテクチャとゼロスキップ最適化を活用して、デバイスの非理想性やノイズへの感受性を低減すること。
  • ハードウェアのばらつきに対しても精度を維持しながら、高スループットかつ低レイテンシのDNN推論を実現すること。

提案手法

  • 同じサブアレイの列に属するすべての重みが同じ符号を持つようにするため、正則化を施した交替方向乗数法(ADMM)を用いてDNNを学習する。これにより、イン・サイト計算が可能になる。
  • ReRAMクロスバーを細分化された論理的サブアレイ(例:8×8または16×16)に分割し、局所的な同じ符号制約を強制することで、ハードウェアの複雑さとノイズ感受性を低減する。
  • 入力活性化がゼロのとき計算をスキップするゼロスキップ論理を導入し、不要な演算と計算時間を顕著に削減する。
  • モデルサイズとハードウェアリソース要件を削減しながら精度を保持するため、構造的プルーニングと量子化を統合する。
  • アナログ計算と効率的なADC変換をサポートするミックスド・シグナルアーキテクチャを設計し、面積と電力のオーバーヘッドを低減する。
  • ReRAMデバイスのばらつきに対する耐性を評価するため、対数正規分布モデルを用い、製造上の非理想性下でも耐性があることを検証する。
Figure 1: Overall Flow of FORMS Algorithm/Hardware Co-designed.
Figure 1: Overall Flow of FORMS Algorithm/Hardware Co-designed.

実験結果

リサーチクエスチョン

  • RQ1細分化されたReRAMサブアレイ内での同じ符号の重み制約は、ミックスド・シグナルDNNアクセラレータにおいて、二重クロスバーまたはオフセット回路の必要性を排除できるか?
  • RQ2ADMMに基づく最適化は、DNN精度を劣化させることなく、どの程度偏極的重みパターンを強制できるか?
  • RQ3ゼロスキップ論理は、ReRAMベースのイン・サイトアクセラレータにおいて、計算時間の短縮とスループットの向上にどの程度効果的か?
  • RQ4偏極化、プルーニング、量子化、ゼロスキップの統合的影響は、最先端の設計と比較して、エネルギー効率とスループットにどのような影響を与えるか?
  • RQ5提案されたアーキテクチャは、ReRAMのデバイスばらつきに対してどの程度耐性を示し、現実的な非理想性下でも精度を維持できるか?

主な発見

  • すべての最適化を適用した場合、FORMSはフレーム/秒(fps)単位で元のISAACアクセラレータと比較して最大377.9倍の高速化を達成し、フラグメントサイズが16の場合に顕著である。
  • 最適化フレームワーク単体でも、ISAACの性能を10.7×から377.9×に向上させ、アルゴリズムとハードウェアの共同最適化の効力を示している。
  • 最適化されたISAACと比較して、FORMSは面積効率を1.50倍、エネルギー効率を1.93倍向上させ、ほぼ同一の電力と面積コストを維持している。
  • 10%のデバイスばらつき(対数正規分布、σ=0.1)下でも、偏極化と量子化を適用した場合、CIFAR-10では1.8%、ImageNetでは4.2%の精度劣化にとどまり、最小限である。
  • ゼロスキップは顕著な貢献を示し、フラグメントサイズが16の場合に、モデル最適化と組み合わせて10.7×から377.9×の高速化を実現している。
  • アーキテクチャは非理想性に対しても安定しており、プルーニングにより1.3%の追加精度劣化が生じるが、プルーニング比の制御により管理可能である。
Figure 2: Structured pruning
Figure 2: Structured pruning

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。