[論文レビュー] Tiny but Accurate: A Pruned, Quantized and Optimized Memristor Crossbar Framework for Ultra Efficient DNN Implementation
本論文は、ADMMに基づく構造的重みプルーニングと8ビット量子化を組み合わせることで、メモリスティルクロスバー上で超効率的なDNN推論を実現する統合的でソフトウェア・ハードウェア共同最適化フレームワークを提案する。プルーニング後の不要な重みと非アクティブな接続を削除するためのネットワーク浄化と未使用パス除去を導入し、VGG-16では最大50.02倍の圧縮を達成したが、精度損失はほぼゼロに抑えられ、VGG-16では44.67倍の圧縮を実現したが、精度低下は0.63%にとどまった。エネルギー効率とハードウェア実装可能性を維持した。
The state-of-art DNN structures involve intensive computation and high memory storage. To mitigate the challenges, the memristor crossbar array has emerged as an intrinsically suitable matrix computation and low-power acceleration framework for DNN applications. However, the high accuracy solution for extreme model compression on memristor crossbar array architecture is still waiting for unraveling. In this paper, we propose a memristor-based DNN framework which combines both structured weight pruning and quantization by incorporating alternating direction method of multipliers (ADMM) algorithm for better pruning and quantization performance. We also discover the non-optimality of the ADMM solution in weight pruning and the unused data path in a structured pruned model. Motivated by these discoveries, we design a software-hardware co-optimization framework which contains the first proposed Network Purification and Unused Path Removal algorithms targeting on post-processing a structured pruned model after ADMM steps. By taking memristor hardware constraints into our whole framework, we achieve extreme high compression ratio on the state-of-art neural network structures with minimum accuracy loss. For quantizing structured pruned model, our framework achieves nearly no accuracy loss after quantizing weights to 8-bit memristor weight representation. We share our models at anonymous link https://bit.ly/2VnMUy0.
研究の動機と目的
- エネルギー効率的な神経形状コンピューティングを実現するため、DNNにおける極端なモデル圧縮の課題に取り組む。
- ADMMベースの構造的プルーニングの限界を克服し、プルーニング後のモデルに残存する不要な重みや未使用パスを解消する。
- 実現可能で高圧縮なDNNデプロイメントを実現するため、メモリスティルハードウェア制約を考慮した共同最適化フレームワークを設計する。
- プルーニング済みモデルに対する近似損失のない8ビット量子化を実現し、ハードウェアフットプリントの低減とエネルギー効率の向上を図る。
- 標準ベンチマークにおいて、Group Scissor や SSL などの既存手法を上回る圧縮比と精度保持性を達成する。
提案手法
- 非凸な構造的プルーニング問題を効率的に最適化できるように、ADMMを用いてDNN重みのスパarsityパターンを最適化する。
- メモリスティルに最適化された量子化を適用し、1重みあたり2デバイスを用いて8ビット重みを4ビットメモリスティル状態にマッピングすることで、ハードウェアオーバーヘッドを低減する。
- ADMMプルーニング後に残存する不要な重みを削除するためのネットワーク浄化を導入し、モデル効率を向上させる。
- 構造的プルーニング済みモデルにおける非アクティブな接続を削除する未使用パス除去を提案し、さらにハードウェアフットプリントを削減する。
- 精度を保持するために、フルプレシジョンのソフトウェアモデルからの知識蒸留を用いて量子化をガイドする。
- MATLABおよびNVSimシミュレーションを用いてフレームワークを検証し、面積と消費電力推定にはHツリー配線と45nm CMOS周辺回路を採用する。
実験結果
リサーチクエスチョン
- RQ1ADMMベースの構造的プルーニングと8ビット量子化を組み合わせることで、メモリスティルクロスバー上で極端な圧縮を達成し、精度損失を最小限に抑えることができるか?
- RQ2ADMM最適化による構造的プルーニング済みモデルでは、どの程度の不要な重みや未使用パスが残存するのか? そして、それらを体系的に削除できるか?
- RQ3提案されたソフトウェア・ハードウェア共同最適化フレームワークは、既存手法と比較して、圧縮比とエネルギー効率をどのように向上させるか?
- RQ4メモリスティルハードウェア制約(例:4ビット精度、1Rクロスバー)は、モデル圧縮と精度にどのような影響を与えるか?
- RQ5特にVGG-16 や ResNet-18 といった深層ネットワークにおいて、プルーニング済みモデルに対する8ビット量子化後も高い精度を維持できるか?
主な発見
- CIFAR-10のVGG-16では、50.02倍の圧縮を達成し、精度低下はわずか0.63%、8ビット量子化後も精度損失なし。
- CIFAR-10のResNet-18では、8ビット量子化後も精度損失なしで59.84倍の圧縮を達成。
- ImageNetでは、ResNet-18で3.33倍の圧縮を達成し、トップ-1精度は88.36%、ResNet-50では2.70倍の圧縮で92.27%の精度を達成。
- P-RM共同最適化により、5.83倍のResNet-18モデルの面積と消費電力を、0.235 mm² と 3.359 W からそれぞれ 0.042 mm² と 0.585 W に削減し、精度損失なし。
- VGG-16では、P-RMを用いることで44.67倍の圧縮を達成し、0.63%の精度低下を記録。50.02倍の圧縮でも0.63%の低下を示し、Group Scissor や SSL を上回る性能を発揮。
- MNISTのLeNet-5では、231.82倍の圧縮を達成し、精度低下はわずか0.4%。40倍および88倍の圧縮比において、量子化後も精度損失なし。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。