Skip to main content
QUICK REVIEW

[論文レビュー] ADMM-NN: An Algorithm-Hardware Co-Design Framework of DNNs Using Alternating Direction Method of Multipliers

Ao Ren, Tianyun Zhang|arXiv (Cornell University)|Dec 31, 2018
Advanced Neural Network Applications参考文献 54被引用数 11
ひとこと要約

ADMM-NNは、交替方向乗数法(ADMM)を用いた、深層ニューラルネットワーク(DNN)圧縮のための共同アルゴリズム・ハードウェア共同設計フレームワークを提案する。重みのプルーニングと量子化を同時に最適化し、動的正則化を用いることで、LeNet-5では最大1,910倍、AlexNetでは231倍のモデルサイズ削減を達成し、精度損失なしに実現。ハードウェア性能向上のため、ブレークイーブンプルーニング比の分析と計算感知最適化を実施。

ABSTRACT

To facilitate efficient embedded and hardware implementations of deep neural networks (DNNs), two important categories of DNN model compression techniques: weight pruning and weight quantization are investigated. The former leverages the redundancy in the number of weights, whereas the latter leverages the redundancy in bit representation of weights. However, there lacks a systematic framework of joint weight pruning and quantization of DNNs, thereby limiting the available model compression ratio. Moreover, the computation reduction, energy efficiency improvement, and hardware performance overhead need to be accounted for besides simply model size reduction. To address these limitations, we present ADMM-NN, the first algorithm-hardware co-optimization framework of DNNs using Alternating Direction Method of Multipliers (ADMM), a powerful technique to deal with non-convex optimization problems with possibly combinatorial constraints. The first part of ADMM-NN is a systematic, joint framework of DNN weight pruning and quantization using ADMM. It can be understood as a smart regularization technique with regularization target dynamically updated in each ADMM iteration, thereby resulting in higher performance in model compression than prior work. The second part is hardware-aware DNN optimizations to facilitate hardware-level implementations. Without accuracy loss, we can achieve 85$ imes$ and 24$ imes$ pruning on LeNet-5 and AlexNet models, respectively, significantly higher than prior work. The improvement becomes more significant when focusing on computation reductions. Combining weight pruning and quantization, we achieve 1,910$ imes$ and 231$ imes$ reductions in overall model size on these two benchmarks, when focusing on data storage. Highly promising results are also observed on other representative DNNs such as VGGNet and ResNet-50.

研究の動機と目的

  • DNNにおける重みのプルーニングと量子化の統合的フレームワークの欠如に対処すること。
  • 従来のヒューリスティック法やグリーディ法では圧縮比を最大限に引き出せないという限界を克服すること。
  • 計算削減、エネルギー効率、不規則なスパarsityに起因するハードウェアオーバーヘッドを考慮した、DNNモデル圧縮とハードウェアパフォーマンスの共同最適化。
  • 最初の畳み込み層のような重要な層でのパフォーマンス劣化を防ぐために、ブレークイーブンプルーニング比という概念を導入すること。
  • 精度損失なしに高い圧縮比を達成するとともに、ハードウェア効率とスループット向上を確保すること。

提案手法

  • ADMMを用いて、重みのプルーニングと量子化を同時に最適化し、組み合わせ的制約を伴う非凸最適化問題として扱う。
  • 各ADMMステップにおいて正則化ターゲットを繰り返し更新する動的正則化を適用し、より知的なスパarsityパターンと量子化パターンを実現。
  • 畳み込み層のプルーニングを全結合層よりも優先することで、計算効率とエネルギー効率を最大化するハードウェア感知最適化戦略を導入。
  • 各層ごとのブレークイーブンプルーニング比(パフォーマンス劣化を避ける最小のプルーニング比)を定義し、パフォーマンスに配慮したプルーニング意思決定を可能にする。
  • 不規則なスパarsityに起因するハードウェアパフォーマンスオーバーヘッドを考慮したADMMベースの最適化を実施。
  • ASIC合成(SMIC 40nm)を用いてハードウェアスループットの有効性を検証し、FPGAおよびASICプラットフォームの代表的な結果を得ることを保証。

実験結果

リサーチクエスチョン

  • RQ1統合的フレームワークは、従来のヒューリスティック法やグリーディ法に比べ、DNN重みのプルーニングと量子化をより効果的に同時に最適化できるか?
  • RQ2不規則なスパarsityに起因するハードウェアパフォーマンスオーバーヘッドは、DNN圧縮段階でどのようにモデル化され、緩和されるか?
  • RQ3パフォーマンス劣化を防ぎつつ圧縮比を最大化するための最適な各層ごとのプルーニング比は何か?
  • RQ4ADMMベースの最適化は、先行研究に比べて精度損失なしにどれほど高い圧縮比を達成できるか?
  • RQ5ハードウェア感知DNN圧縮は、計算とメモリのボトルネックを考慮しても、実際に合成されたアクセラレータでスループット向上を達成できるか?

主な発見

  • ADMM-NNは、LeNet-5とAlexNetにおいて、それぞれ1,910倍および231倍のモデルサイズ削減を達成し、精度損失なしに実現。
  • 本フレームワークは、LeNet-5とAlexNetでそれぞれ85倍および24倍の重みプルーニング比を達成し、先行研究を著しく上回る。
  • 精度損失なしに計算量を3.6倍削減し、既存手法を上回る性能を発揮。
  • ハードウェア合成の結果、ベースラインモデルに比べてスループット向上を確認。一方、ベースラインは不規則なスパarsityと不適切なプルーニング意思決定によりパフォーマンス劣化を示した。
  • 最初の畳み込み層は、ボトルネックとして機能するため、ブレークイーブンしきい値未満のプルーニング比(未プルーニング)を維持。
  • 本手法は一般化性に優れ、VGGNetおよびResNet-50でも良好な結果を示し、多様なDNNアーキテクチャにスケーラブルであることを実証。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。