Skip to main content
QUICK REVIEW

[論文レビュー] SmartExchange: Trading Higher-cost Memory Storage/Access for Lower-cost Computation

Yang Zhao, Xiaohan Chen|arXiv (Cornell University)|May 7, 2020
Advanced Neural Network Applications参考文献 51被引用数 8
ひとこと要約

SmartExchangeは、DNN推論における高コストなメモリアクセスを、小さな基底行列とスパースで2の累乗値をとる係数行列の積として重みを表現することで、低コストな計算に置き換えるアルゴリズム・ハードウェア共同設計フレームワークを提案する。この手法は、Pruning、分解、量子化を統合し、さまざまなモデルとデータセットにおいて、最先端のアクセラレータ比で最大6.7倍のエネルギー効率向上と19.2倍の低遅延を達成する。

ABSTRACT

We present SmartExchange, an algorithm-hardware co-design framework to trade higher-cost memory storage/access for lower-cost computation, for energy-efficient inference of deep neural networks (DNNs). We develop a novel algorithm to enforce a specially favorable DNN weight structure, where each layerwise weight matrix can be stored as the product of a small basis matrix and a large sparse coefficient matrix whose non-zero elements are all power-of-2. To our best knowledge, this algorithm is the first formulation that integrates three mainstream model compression ideas: sparsification or pruning, decomposition, and quantization, into one unified framework. The resulting sparse and readily-quantized DNN thus enjoys greatly reduced energy consumption in data movement as well as weight storage. On top of that, we further design a dedicated accelerator to fully utilize the SmartExchange-enforced weights to improve both energy efficiency and latency performance. Extensive experiments show that 1) on the algorithm level, SmartExchange outperforms state-of-the-art compression techniques, including merely sparsification or pruning, decomposition, and quantization, in various ablation studies based on nine DNN models and four datasets; and 2) on the hardware level, the proposed SmartExchange based accelerator can improve the energy efficiency by up to 6.7$ imes$ and the speedup by up to 19.2$ imes$ over four state-of-the-art DNN accelerators, when benchmarked on seven DNN models (including four standard DNNs, two compact DNN models, and one segmentation model) and three datasets.

研究の動機と目的

  • リソース制限のあるエッジデバイスにおけるDNN推論におけるデータ移動の高コストなエネルギー消費を軽減すること。
  • DNN重みをコンactで計算に適した形に再構築することで、重みの保存領域とDRAMアクセスエネルギーの両方を削減すること。
  • 構造的スパarsityと2の累乗量子化を活用した最大のエネルギー効率と遅延効率を実現するアルゴリズムとアクセラレータの共同設計を行うこと。
  • Pruning、分解、量子化の3つの主要な圧縮技術を、一つの統合的で相乗効果のあるフレームワークに統合すること。

提案手法

  • 各レイヤーの重み行列を、小さな基底行列と、2の累乗値のみを非ゼロ要素とする大規模なスパース係数行列の積として表現する。
  • 係数行列にスパarsityと2の累乗量子化を適用し、乗算累積演算の代わりにシフトアド演算を可能にする。
  • 高い圧縮率を達成しながらモデル精度を維持できる再訓練に配慮したSmartExchangeアルゴリズムを開発する。
  • ベクトル単位の構造的スパarsityとコンactな重みを活用できるように最適化されたデータフローとプロセッシング要素構成を持つ専用アクセラレータを設計する。
  • ゼロ重みおよびゼロ活性化パスの計算とメモリアクセスをスキップするハードウェアに配慮したデータフローを実装する。
  • ビットレベルおよびベクトル単位のスパarsityを活用し、推論中のエネルギー消費と遅延の両方を削減する。

実験結果

リサーチクエスチョン

  • RQ1Pruning、分解、量子化を統合したフレームワークは、個別の技術と比較して、優れた圧縮効率を達成できるか?
  • RQ2構造的スパarsityと2の累乗量子化は、DNN推論におけるメモリアクセスエネルギーと計算コストをどの程度削減できるか?
  • RQ3提案されたアクセラレータは、SmartExchangeの重み構造をどの程度効果的に活用してエネルギー効率と遅延を改善できるか?
  • RQ4SmartExchangeフレームワークは、極めて高い圧縮率と低コストな計算を実現しながらも、高いモデル精度を維持できるか?

主な発見

  • 9つのモデルと4つのデータセットにおいて、アブレーションスタディで最先端の圧縮技術を上回り、2%未満の精度損失を実現した。
  • SmartExchangeアクセラレータは、4つの最先端のDNNアクセラレータと比較して、最大6.7倍のエネルギー効率向上と19.2倍の低遅延を達成した。
  • ResNet50では、重みのスパarsityを45.0%から60.0%に向上させることで、DRAMエネルギー消費を18.33%削減し、遅延を41.83%低減した。
  • MobileNetV2のディープワイド畳み込み層では、専用アクセラレータ設計により、エネルギーコストを最大28.8%、遅延を最大65.7%削減した。
  • フレームワークは効果的にベクトル単位の構造的スパarsityを活用し、メモリアクセスと計算の両面で顕著な節約を実現した。
  • SmartExchangeと再訓練の統合により、高いモデル精度を維持しながら、極めて高い圧縮率と低コストな計算を実現できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。