[論文レビュー] Benchmarking and modeling of analog and digital SRAM in-memory computing architectures
本稿では、アナログ型インメモリコンピューティング(AIMC)とデジタル型インメモリコンピューティング(DIMC)アーキテクチャを評価するための統一的で分析的なコストモデルを提示する。これにより、多様な設計間での公平で定量的な比較が可能になる。ZigZag DSEフレームワークに統合されたモデルは、大規模なAIMCアレイが高再利用性の畳み込み層(例:ResNet8)で優れた性能を発揮する一方で、小規模で分散型のDIMCマクロは低再利用性のポイントワイズ層(例:MobileNetV1)で優位であることを明らかにした。これは、アレイサイズ、データフロー、エネルギー効率の間の重要なトレードオフを示している。
In-memory-computing is emerging as an efficient hardware paradigm for deep neural network accelerators at the edge, enabling to break the memory wall and exploit massive computational parallelism. Two design models have surged: analog in-memory-computing (AIMC) and digital in-memory-computing (DIMC), offering a different design space in terms of accuracy, efficiency and dataflow flexibility. This paper targets the fair comparison and benchmarking of both approaches to guide future designs, through a.) an overview of published architectures; b.) an analytical cost model for energy and throughput; c.) scheduling of workloads on a variety of modeled IMC architectures for end-to-end network efficiency analysis, offering valuable workload-hardware co-design insights.
研究の動機と目的
- 異なる技術と設計パrameterを有するAIMC/DIMCアーキテクチャの間で、公平で定量的なベンチマークを可能にするため。
- 公開済みのAIMCおよびDIMC設計の両方で検証された、エネルギーとスループットを統一的に推定する分析的コストモデルの開発。
- 実DNNワークロードのエンドツーエンド効率分析を可能にするために、ZigZag設計空間探索(DSE)フレームワークにモデルを統合。
- 複数のアーキテクチャとtinyMLPerfベンチマークを対象に、空間的および時間的マッピングを評価することで、ワークロード・ハードウェア共同最適化の知見を提供。
- ネットワーク特性やアレイ構成が変化する状況下でのAIMCおよびDIMCパラダイムの強みと限界を特定。
提案手法
- 著者らは、異なるプロセス技術を用いた10の公開済みAIMCおよびDIMC設計から、アレイサイズ、マクロ数、プロセスノード、精度などのアーキテクチャ的パrameterを抽出。
- エネルギーとスループットを推定するための統一的分析的コストモデルを構築。設計ポイントとの比較で約15%の相対誤差で妥当性を検証。
- マクロレベルのエネルギー消費と、外部メモリレベルへのデータ移動コストを組み込み、被演算子の再利用と周辺回路のオーバーヘッドを考慮。
- ZigZag DSEフレームワークにモデルを統合し、各ネットワーク層およびハードウェア構成における最適な空間的および時間的マッピングを探索。
- 実DNNワークロードのエンドツーエンド効率を評価するため、tinyMLPerfベンチマークモデル(例:DeepAutoEncoder, ResNet8, MobileNetV1, DS-CNN)を用いてワークロード評価を実施。
- 異なるアレイサイズとマクロ数における、エネルギー分解と外部メモリへのデータトラフィックを分析し、利用度とオーバーヘッドのトレードオフを明らかに。
実験結果
リサーチクエスチョン
- RQ1異なるAIMCおよびDIMCアーキテクチャ的パrameter(アレイサイズ、マクロ数、プロセスノード)が、実DNNワークロードにおけるエネルギー効率とスループットに与える影響は何か?
- RQ2大規模アレイ型AIMCが小規模で分散型のDIMCアーキテクチャを上回る状況と、逆にその逆が成立する状況はそれぞれどのようなものか?
- RQ3空間的および時間的マッピングの選択が、多様なDNN層におけるIMCアクセラレータのエネルギー効率にどのように影響するか?
- RQ4異なるIMC設計ポイントにおいて、マクロレベルのエネルギー効率とオフチップデータ移動オーバーヘッドの相対的トレードオフは何か?
- RQ5統一的分析的モデルは、多様なAIMCおよびDIMC設計間で、どれほど正確に性能を予測できるか?
主な発見
- 大規模なAIMCアレイは、重みの再利用が顕著な高再利用性層(例:ResNet8)でピークエネルギー効率を発揮し、特徴マップのピクセル間での重み再利用によってライトコストが相殺される。
- 全結合層のみで構成されるネットワーク(例:DeepAutoEncoder)では、重みの再利用が見られないため、AIMCの利点は消失し、頻繁な重み再ライトによる高いエネルギーコストが発生する。
- 小規模で分散型のDIMCマクロは、低再利用性、ポイントワイズおよびディープワイズ畳み込み層(例:MobileNetV1, DS-CNN)で大規模アレイを上回る性能を発揮する。大規模アレイでは計算の未利用が顕著になる。
- マクロ数の増加は、非IMC次元(例:OX, OY, G)の空間的並列化を向上させるが、特徴マップおよび部分和のオフチップデータ移動が増加し、エネルギーオーバーヘッドが上昇する。
- 統一的分析的モデルは、公開済みの設計ポイントとの比較で約15%の相対誤差を示し、異種IMC設計間のベンチマークにおいて高い正確性を示した。
- ZigZagへのモデル統合により、最適マッピングの体系的探索が可能となり、最適設計がワークロード特性と層の種別に強く依存することが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。