[論文レビュー] An Ultra-Efficient Memristor-Based DNN Framework with Structured Weight Pruning and Quantization Using ADMM
本稿では、ADMMを用いて構造的重みプルーニングと量子化を統合的に最適化することで、超低消費電力および面積効率を達成する、統合型メモリスタベースDNNフレームワークを提案する。VGG-16では最大29.81倍の重み圧縮を達成し、精度損失はたった0.5%にとどまる。また、導電率範囲やデバイス不一致といったハードウェア制約を満たした上で、98.38%の消費電力削減と98.29%の面積削減を実現した。
The high computation and memory storage of large deep neural networks (DNNs) models pose intensive challenges to the conventional Von-Neumann architecture, incurring substantial data movements in the memory hierarchy. The memristor crossbar array has emerged as a promising solution to mitigate the challenges and enable low-power acceleration of DNNs. Memristor-based weight pruning and weight quantization have been seperately investigated and proven effectiveness in reducing area and power consumption compared to the original DNN model. However, there has been no systematic investigation of memristor-based neuromorphic computing (NC) systems considering both weight pruning and weight quantization. In this paper, we propose an unified and systematic memristor-based framework considering both structured weight pruning and weight quantization by incorporating alternating direction method of multipliers (ADMM) into DNNs training. We consider hardware constraints such as crossbar blocks pruning, conductance range, and mismatch between weight value and real devices, to achieve high accuracy and low power and small area footprint. Our framework is mainly integrated by three steps, i.e., memristor-based ADMM regularized optimization, masked mapping and retraining. Experimental results show that our proposed framework achieves 29.81X (20.88X) weight compression ratio, with 98.38% (96.96%) and 98.29% (97.47%) power and area reduction on VGG-16 (ResNet-18) network where only have 0.5% (0.76%) accuracy loss, compared to the original DNN models. We share our models at link http://bit.ly/2Jp5LHJ.
研究の動機と目的
- 従来のフォン・ノイマンアーキテクチャでは、大規模DNNの計算およびメモリ要件が増大している問題に対処する。
- メモリスタベースのニューロモルフィックコンピューティングにおけるハードウェア制限、例えばバランスの取れないワークロード、不規則なメモリアクセス、デバイスの不完全性を克服する。
- メモリスタベースDNNにおいて、構造的重みプルーニングと重み量子化を体系的に統合し、圧縮率とエネルギー効率を最大化する。
- 現実のメモリスタ制約をトレーニングプロセスに組み込むことで、高いモデル精度とハードウェア実装可能性を確保する。
- ADMMを用いてプルーニングと量子化を統合的に最適化する統一フレームワークを開発し、精度の低下を最小限に抑えつつ、ハードウェア効率を最大化する。
提案手法
- ADMMを用いて、DNNトレーニング中に構造的重みプルーニングと量子化を同時に最適化し、ハードウェア制約のもとでエンドツーエンド最適化を可能にする。
- クロスバー・ブロックのプルーニング、導電率範囲の制限、デバイス不一致といったハードウェア固有の制約を、ADMM正則化最適化プロセスに統合する。
- マスクドマッピングを用いて構造的スパarsityを強制し、メモリスタクロスバー配列アーキテクチャとの互換性を確保する。
- プルーニングおよび量子化後に再トレーニングを実施し、ハードウェア制約下での精度回復とモデルパフォーマンスの最適化を図る。
- ゼロ対称で均等なレベルの量子化を設計し、重みをゼロにマップすることを回避することで、量子化誤差を低減し、ハードウェアマッピングの忠実度を向上させる。
- 状態ドリフトやプロセスばらつきなどのメモリスタの不完全性の影響を量子化プロセスに組み込むことで、耐障害性と精度を向上させる。
実験結果
リサーチクエスチョン
- RQ1メモリスタベースDNNフレームワークにおいて、構造的重みプルーニングと重み量子化を統合的に最適化することで、より高い圧縮率と低い消費電力が達成可能か?
- RQ2実際のメモリスタハードウェア制約のもとで、プルーニングと量子化を統合的に最適化するADMMベースの最適化は、精度と実装可能性をどのように向上させるか?
- RQ3VGG-16 や ResNet-18 などの深層ネットワークに、プルーニングと量子化を統合して適用した場合、圧縮比、消費電力/面積削減、精度損失のトレードオフはどのように変化するか?
- RQ4ハードウェアに配慮した量子化は、導電率不一致や状態ドリフトといったメモリスタの不完全性の影響をどの程度軽減できるか?
- RQ5Group Scissor などの既存手法と比較して、本フレームワークは圧縮比、精度、エネルギー効率の点でどの程度優れているか?
主な発見
- 提案フレームワークは、VGG-16では29.81倍(ResNet-18では20.88倍)の重み圧縮比を達成し、元のモデルと比較して精度損失はわずか0.5%(0.76%)にとどまる。
- 5ビット量子化下で、VGG-16では98.38%の消費電力削減と98.29%の面積削減を達成。ResNet-18では96.96%の消費電力削減と97.47%の面積削減を実現した。
- LeNet-5 および ConvNet において、本フレームワークはGroup Scissorを上回る精度と圧縮比を達成し、6ビット量子化下で17.69倍の圧縮を実現し、精度損失はたった0.1%にとどまった。
- CIFAR-10で、VGG-16 や ResNet-18 といったより深いネットワークでも、高い圧縮率下でもほぼ理想に近い精度を維持した。29.81倍圧縮時で0.8%、20.88倍圧縮時で0.6%の精度損失を記録した。
- 5ビット量子化が、全テスト対象ネットワークで最大の消費電力および面積削減をもたらした。最大で98.38%の消費電力削減と98.29%の面積削減を達成した。
- 量子化におけるゼロマッピングを回避し、デバイスレベルの不完全性を最適化プロセスに組み込むことで、高い精度とハードウェア実装可能性を維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。