Skip to main content
QUICK REVIEW

[論文レビュー] A SOT-MRAM-based Processing-In-Memory Engine for Highly Compressed DNN Implementation

Geng Yuan, Xiaolong Ma|arXiv (Cornell University)|Nov 24, 2019
Advanced Neural Network Applications参考文献 34被引用数 9
ひとこと要約

本稿では、SOT-MRAMベースの処理内メモリ(PIM)エンジン向けに、ADMMに基づくモデル圧縮フレームワークを提案する。トレーニング段階で構造的重みプルーニングと低ビット量子化を併用することで、高い圧縮率とエネルギー効率を実現しながら、高い精度を維持するとともにスループットを向上させ、MNISTでは最大81.3倍の圧縮を達成し、精度損失を最小限に抑えた。

ABSTRACT

The computing wall and data movement challenges of deep neural networks (DNNs) have exposed the limitations of conventional CMOS-based DNN accelerators. Furthermore, the deep structure and large model size will make DNNs prohibitive to embedded systems and IoT devices, where low power consumption are required. To address these challenges, spin orbit torque magnetic random-access memory (SOT-MRAM) and SOT-MRAM based Processing-In-Memory (PIM) engines have been used to reduce the power consumption of DNNs since SOT-MRAM has the characteristic of near-zero standby power, high density, none-volatile. However, the drawbacks of SOT-MRAM based PIM engines such as high writing latency and requiring low bit-width data decrease its popularity as a favorable energy efficient DNN accelerator. To mitigate these drawbacks, we propose an ultra energy efficient framework by using model compression techniques including weight pruning and quantization from the software level considering the architecture of SOT-MRAM PIM. And we incorporate the alternating direction method of multipliers (ADMM) into the training phase to further guarantee the solution feasibility and satisfy SOT-MRAM hardware constraints. Thus, the footprint and power consumption of SOT-MRAM PIM can be reduced, while increasing the overall system throughput at the meantime, making our proposed ADMM-based SOT-MRAM PIM more energy efficiency and suitable for embedded systems or IoT devices. Our experimental results show the accuracy and compression rate of our proposed framework is consistently outperforming the reference works, while the efficiency (area \& power) and throughput of SOT-MRAM PIM engine is significantly improved.

研究の動機と目的

  • 大規模DNNの埋め込みおよびIoTシステムへの導入におけるエネルギーおよびハードウェア制約に対処すること。
  • SOT-MRAM PIMの限界(高い書き込み遅延、低ビット幅サポート)を、ソフトウェアレベルのモデル圧縮により克服すること。
  • 構造的プルーニングと低ビット量子化を統合した包括的フレームワークを構築し、SOT-MRAMハードウェア制約に適合させること。
  • トレーニング段階にADMMを組み込むことで、圧縮後およびハードウェアマッピング後の高いモデル精度と実現可能性を確保すること。
  • 最適化されたモデル圧縮により、SOT-MRAM PIMエンジンのシステムスループットを向上させるとともに、電力/面積消費を低減すること。

提案手法

  • 交替方向乗数法(ADMM)を用いて重みプルーニングと量子化を最適化問題として定式化し、構造的スパarsityおよび低ビット表現の反復的かつ解析的解法を可能にする。
  • ハードウェア効率を最大化し、余分な計算を最小限に抑えるために、フィルタ、チャネル、キーネルプルーニングを組み合わせたスケーリング方式を適用する。
  • SOT-MRAM PIMのビット並列処理アーキテクチャと自然に整合する微小で規則的な空間パターンを持つ構造的プルーニングモデルを設計し、効率的なメモリ内計算を実現する。
  • 圧縮されたDNNモデルをSOT-MRAM PIMエンジンにマッピングし、AND、ビットカウント、ビットシフト演算を用いてビット単位の畳み込みを実行することで、高いエネルギー効率を達成する。
  • 実験では8ビット量子化を用い、サブアレイの行数を削減し、さらに面積と電力消費を低減する。
  • バッファおよびインターコネクトのモデリングにCacti 7を、メモリサブアレイのエネルギー/面積推定にNVSimに変更されたSOT-MRAMパラメータを、外部ADCの電力/面積データには外部データを活用する。

実験結果

リサーチクエスチョン

  • RQ1ADMMを用いた構造的プルーニングと低ビット量子化の併用は、SOT-MRAM PIMアーキテクチャ上で高い圧縮率を達成しながらDNNの精度を維持できるか?
  • RQ2標準的なプルーニングやバイナリゼーションと比較して、ADMMベースの圧縮はSOT-MRAM PIMにおけるソリューションの実現可能性とハードウェア互換性をどのように向上させるか?
  • RQ3モデル圧縮は、システムスループットを劣化させることなく、SOT-MRAM PIMエンジンの面積および電力消費をどの程度低減できるか?
  • RQ4SOT-MRAM PIMシステムにおいて、異なるプルーニングタイプ(フィルタ、チャネル、キーネル)を適用した場合、圧縮率、精度、ハードウェア効率のトレードオフはどのように変化するか?
  • RQ5標準ベンチマーク上で、最先端の圧縮手法と比較して、本フレームワークは圧縮率、精度、エネルギー効率の観点でどの程度優れているか?

主な発見

  • 提案フレームワークは、MNIST用LeNet-5で81.3倍の圧縮を達成し、精度低下はたった0.02%にとどまり、グループスカイサーメソッドを19.4倍の圧縮率で上回った。
  • CIFAR-10では、ResNet-18とVGG-16でそれぞれ59.8倍および44.8倍の圧縮を達成し、ベースライン手法と比較して精度損失は最小限だった。
  • ImageNetでは、AlexNet、ResNet-18、VGG-16でそれぞれ5.2倍、3.0倍、2.7倍の圧縮を達成し、トップ-1精度をベースラインモデルと1%以内に維持した。
  • チャネルプルーニングが、処理素子およびその周辺回路を完全に削除することで、電力および面積の低減に最も寄与した。
  • フィルタおよびキーネルプルーニングにより、SOT-MRAMサブアレイ全体での計算イテレーション回数が削減され、システムスループットが向上した。
  • SOT-MRAM PIMエンジンの電力および面積消費は顕著に低減され、圧縮設計と比較して全体のシステムスループットも向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。