Skip to main content
QUICK REVIEW

[論文レビュー] Edge AI without Compromise: Efficient, Versatile and Accurate Neurocomputing in Resistive Random-Access Memory

Weier Wan, Rajkumar Kubendran|arXiv (Cornell University)|Aug 17, 2021
Advanced Memory and Neural Computing参考文献 52被引用数 11
ひとこと要約

この論文では、マルチモーダルエッジAIワークロードにおいて、同時に高いエネルギー効率、多様性、正確性を達成する最初の抵抗性メモリ(RRAM)ベースの計算内メモリチップであるNeuRRAMを提示する。アルゴリズム、アーキテクチャ、回路、デバイスを共同最適化することで、複数のビット精度において先行技術比5×–8×の優れたエネルギー効率を達成し、MNISTで99.0%、CIFAR-10で85.7%というベンチマークでソフトウェアレベルの正確性を維持する。

ABSTRACT

Realizing today's cloud-level artificial intelligence functionalities directly on devices distributed at the edge of the internet calls for edge hardware capable of processing multiple modalities of sensory data (e.g. video, audio) at unprecedented energy-efficiency. AI hardware architectures today cannot meet the demand due to a fundamental "memory wall": data movement between separate compute and memory units consumes large energy and incurs long latency. Resistive random-access memory (RRAM) based compute-in-memory (CIM) architectures promise to bring orders of magnitude energy-efficiency improvement by performing computation directly within memory. However, conventional approaches to CIM hardware design limit its functional flexibility necessary for processing diverse AI workloads, and must overcome hardware imperfections that degrade inference accuracy. Such trade-offs between efficiency, versatility and accuracy cannot be addressed by isolated improvements on any single level of the design. By co-optimizing across all hierarchies of the design from algorithms and architecture to circuits and devices, we present NeuRRAM - the first multimodal edge AI chip using RRAM CIM to simultaneously deliver a high degree of versatility for diverse model architectures, record energy-efficiency $5 imes$ - $8 imes$ better than prior art across various computational bit-precisions, and inference accuracy comparable to software models with 4-bit weights on all measured standard AI benchmarks including accuracy of 99.0% on MNIST and 85.7% on CIFAR-10 image classification, 84.7% accuracy on Google speech command recognition, and a 70% reduction in image reconstruction error on a Bayesian image recovery task. This work paves a way towards building highly efficient and reconfigurable edge AI hardware platforms for the more demanding and heterogeneous AI applications of the future.

研究の動機と目的

  • 抵抗性メモリ(RRAM)を用いてメモリ内に計算を統合することで、エッジAIハードウェアにおけるエネルギー効率を制限する根本的な「メモリウォール」を克服する。
  • 既存の計算内メモリ(CIM)アーキテクチャにおける効率性、多様性、正確性のトレードオフを克服する。
  • 1つの再構成可能なハードウェアプラットフォーム上で、画像、音声、ベイジアン再構成など多様なAIワークロードにおける高性能な推論を可能にする。
  • RRAMデバイス固有のハードウェアの不完全性が存在するにもかかわらず、ソフトウェアと同等の推論正確性を実現する。
  • アルゴリズム、アーキテクチャ、回路、デバイスのレベルを横断する共同設計手法を提示し、エッジAIシステムの包括的最適化を可能にする。

提案手法

  • RRAMクロスバー配列を用いた計算内メモリ(CIM)アーキテクチャを開発し、メモリ内ですべての行列-ベクトル乗算を直接実行することで、外部メモリへのデータ移動を排除する。
  • 4ビット、8ビット、16ビットの重みをサポートするハイブリッド精度処理方式を実装し、多様なモデルにおける正確性とエネルギー効率のバランスを図る。
  • 抵抗率の変動や時間的変化といったRRAMデバイスの非理想特性を低減するためのマルチレベルキャリブレーションおよび誤差補償フレームワークを設計する。
  • 動的再構成が可能な制御論理とオンチップメモリ管理を統合し、異なるAIモデルタイプや入力モダリティ間での切り替えを可能にする。
  • 階層的な共同設計アプローチを採用:ニューラルネットワークの量子化、メモリアレイレイアウト、アナログ回路設計、デバイス特性を一体的に最適化する。
  • アナログ計算のノイズにかかわらず高い推論正確性を維持するため、独自のアナログ-デジタル変換(ADC)およびデジタル信号処理パイプラインを活用する。

実験結果

リサーチクエスチョン

  • RQ11つのRRAMベースのCIMアーキテクチャが、多様なAIワークロードにおいて同時に高いエネルギー効率、機能的多様性、高い推論正確性を達成できるか?
  • RQ2RRAMデバイスに内在するハードウェアの不完全性は、どのように効果的に補償できるか? これによりエッジAI推論におけるモデル正確性が保たれるか?
  • RQ3アルゴリズム、アーキテクチャ、回路、デバイスのレベルで共同設計を実施することで、効率性、多様性、正確性のトレードオフをどの程度解消できるか?
  • RQ4標準ベンチマーク上で、ソフトウェアベースのAIモデルとRRAMベースのハードウェア推論との間に、どの程度の性能ギャップが生じるか?
  • RQ5再構成可能なRRAM CIMチップは、画像分類、音声認識、ベイジアン画像回復といったマルチモーダルAIタスクを、性能劣化を伴わずサポートできるか?

主な発見

  • NeuRRAMは、4ビット、8ビット、16ビットの推論タスクにおいて、先行技術比5×–8×の優れたエネルギー効率を達成し、既存のCIMソリューションを著しく上回る。
  • MNIST画像分類ベンチマークでは99.0%の正確性を達成し、フル精度のソフトウェアモデルと同等の性能を示す。
  • Googleの音声コマンド認識タスクでは84.7%の正確性を達成し、モダリティを越えた頑健性を示す。
  • ベイジアン画像回復においては、ベースライン手法と比較して画像再構成誤差を70%削減し、生成的および逆問題において優れた性能を示す。
  • 効果的な誤差補償およびキャリブレーション技術のおかげで、全テストビット精度において高い正確性を維持する。
  • 共同設計フレームワークにより、異なるAIモデルおよび入力タイプへのシームレスな再構成が可能であり、異種エッジAIワークロードにおけるチップの多様性を実証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。