[論文レビュー] A 481pJ/decision 3.4M decision/s Multifunctional Deep In-memory Inference Processor using Standard 6T SRAM Array
本稿では、65 nm CMOS 16KB標準6T SRAMベースの深層記憶内推論プロセッサを提示する。このプロセッサは、4つのアプリケーション(SVM、マッチドフィルタ、テンプレートマッチング、KNN)において、最大5.6倍のエネルギー削減と≤1%の精度損失を達成し、1秒間に340万回の意思決定を3.4M decisions/sの速度で実現し、1回の意思決定あたり481 pJのエネルギー消費を実現した。本プロセッサは、SRAMビットセルアレイ内でのピッチマッチドアナログ処理により、マルチファンクショナルな推論を実現する。具体的には、サブレンジングマルチロウ機能的リード、再構成可能なビットラインおよびクロスビットライン処理、低スイング電荷共有計算を用い、外部メモリへのデータ移動を排除することでエネルギー効率を高めた。
This paper describes a multi-functional deep in-memory processor for inference applications. Deep in-memory processing is achieved by embedding pitch-matched low-SNR analog processing into a standard 6T 16KB SRAM array in 65 nm CMOS. Four applications are demonstrated. The prototype achieves up to 5.6X (9.7X estimated for multi-bank scenario) energy savings with negligible (<1%) accuracy degradation in all four applications as compared to the conventional architecture.
研究の動機と目的
- 従来のディープラーニング推論アーキテクチャにおける高いエネルギーコストとメモリ帯域幅のボトル neck を解消するため、アナログ計算をSRAMアレイに直接埋め込むこと。
- ストレージ密度やリード/ライト機能を変更せずに、1つの標準6T SRAMアレイ内でマルチファンクショナルな推論(ドット積、マンハッタン距離、分類)を実現すること。
- サブレンジングマルチロウ機能的リードと電荷共有計算を活用した、メモリ内処理の並列性を最大限に活かした高エネルギー効率かつ高スループットな処理を実現すること。
- SRAMアレイ内でのイン・サイトアナログ操作と読み取りサイクルの削減により、メモリアクセスエネルギーを低減しながら、精度の著しい低下(<1%)を抑えること。
提案手法
- 複数の行にわたる重み付き和の計算を1つのプレチャージサイクル内で実現するため、パルス幅変調されたワードライン(PWM-WL)信号を用いてマルチロウ機能的リード(MR-FR)を実行する。
- 8ビットワードを4 MSBと4 LSBの列に分割し、1/16の比で電荷共有を行うことで、列ピッチ制約内での高分解能アナログ計算を可能にする。
- アナログマルチプレクサとコンパレータを用いて、ビットライン処理(BLP)およびクロスビットライン処理(CBLP)ステージを、ドット積(DP)モードまたはマンハッタン距離(MD)モードに再構成可能に設計する。
- 逐次ビット処理によるミックスシグナル容量乗算器に加え、並列処理による4ビットMSB/LSB乗算器を組み合わせることで、スループットを向上させる。
- 同時プレチャージと処理を可能にするデジタルコントローラとパイプラインアーキテクチャを統合し、1サイクルあたり128×8ビットワードのアクセスを実現する。
- エネルギー効率の高い単斜面ADCを用い、2つの連続するCBLP出力間で電荷共有を行うことで、消費電力を低減する。
実験結果
リサーチクエスチョン
- RQ1標準6T SRAMアレイを、ストレージ機能やリード/ライト機能を変更せずに、マルチファンクショナルな深層記憶内推論に拡張可能か?
- RQ2プロセス変動を含む条件下でもピッチマッチングと線形性を維持しながら、SRAMビットセルアレイ内にアナログ計算を埋め込む方法は何か?
- RQ3SRAMアレイ内でのイン・サイト計算により読み取りサイクルを削減することで、エネルギー効率をどの程度向上できるか?
- RQ465 nm CMOSプロセスにおいて、低スイング・電荷共有アナログ計算を用いる場合の精度とエネルギーのトレードオフは何か?
- RQ5同じハードウェアが、SVM、KNN、テンプレートマッチングなどの複数の推論ワークロードを再構成可能な処理ステージによりサポート可能か?
主な発見
- プロトタイプは、1秒間に340万回の意思決定を481 pJ/意思決定のエネルギー消費で実現し、従来のアーキテクチャと比較して最大5.6倍のエネルギー削減を達成し、4つのアプリケーションすべてで≤1%の精度損失を示した。
- サブレンジングマルチロウ機能的リードにより、メモリアクセスエネルギーが16倍削減された。これは、列マルチプレクシングによる8×8ビットワードのアクセスではなく、1回のアクセスサイクルで128×8ビットワードを処理できるためである。
- サブレンジングMR-FRの測定最大INLは0.03 LSBであり、アナログ・デジタル変換における高い線形性を保証している。
- DPモードでは最大誤差の絶対値が出力ダイナミックレンジの5.8%、MDモードでは8.6%であった。
- エネルギー消費の内訳から、MR-FRステージがエネルギー削減に最も寄与しており、ΔVBLが20 mV低下するごとにCOREエネルギーが0.2 pJ減少した。
- マルチバンク環境では、推定エネルギー削減はDPモードで最大9.7倍、MDモードで5.4倍に達し、コントローラのエネルギーはバンク間で均等に分散される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。