Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Neural Network Compression by Sparsity-Quantization Joint Learning: A Constrained Optimization-based Approach

Haichuan Yang, Shupeng Gui|arXiv (Cornell University)|Oct 14, 2019
Advanced Neural Network Applications参考文献 55被引用数 5
ひとこと要約

本論文は、層ごとの圧縮比を手動で設定する必要のない、エンドツーエンドの自動ニューラルネットワーク圧縮のための制約付き最適化ベースのフレームワークを提案する。圧縮比の制約をスパース・量子化モデルサイズ制約として定式化し、ADMMを用いて最適化することで、CIFAR-10でResNet-50に対して836×の圧縮を達成し、精度に損失なし。ImageNetでAlexNetに対して205×の圧縮を達成し、精度に損失なし。

ABSTRACT

Deep Neural Networks (DNNs) are applied in a wide range of usecases. There is an increased demand for deploying DNNs on devices that do not have abundant resources such as memory and computation units. Recently, network compression through a variety of techniques such as pruning and quantization have been proposed to reduce the resource requirement. A key parameter that all existing compression techniques are sensitive to is the compression ratio (e.g., pruning sparsity, quantization bitwidth) of each layer. Traditional solutions treat the compression ratios of each layer as hyper-parameters, and tune them using human heuristic. Recent researchers start using black-box hyper-parameter optimizations, but they will introduce new hyper-parameters and have efficiency issue. In this paper, we propose a framework to jointly prune and quantize the DNNs automatically according to a target model size without using any hyper-parameters to manually set the compression ratio for each layer. In the experiments, we show that our framework can compress the weights data of ResNet-50 to be 836$ imes$ smaller without accuracy loss on CIFAR-10, and compress AlexNet to be 205$ imes$ smaller without accuracy loss on ImageNet classification.

研究の動機と目的

  • DNNの prune と quantization における層ごとの圧縮比の手動ハイパーパrameterチューニングを排除すること。
  • 新たなハイパーパrameterを導入せずに、スパarsityと量子化ビット幅のエンドツーエンドの共同最適化を可能にすること。
  • ユーザーが定義したモデルサイズ予算内で高い圧縮比を達成するとともに、モデルの精度を維持すること。
  • 強化学習やベイズ最適化などのブラックボックス最適化手法の代替として、安定的かつ効率的な手法を提供すること。
  • モデル構造とデータの感度に基づいて、各層に最適な圧縮比を自動的に割り当てること。

提案手法

  • DNN圧縮を、ハードなモデルサイズ制約を課した制約付き最適化問題として定式化する。
  • 元の重みとその圧縮版を分離するための「ソフトダブル」重み変数を導入する。
  • 交替方向乗数法(ADMM)を用いて、制約付き最適化問題を効率的に解く。
  • 圧縮された重みにスパース+量子化制約を課し、スパarsityと低ビット表現の両方を保証する。
  • 元の重み、圧縮された重み、および双対変数を交互に更新する最適化戦略を採用する。
  • ハイパーパrameterサーチではなく最適化によって、自動的に各層の最適なスパarsityとビット幅を決定する。

実験結果

リサーチクエスチョン

  • RQ1手動またはブラックボックスのハイパーパrameterチューニングに依存せずに、pruningとquantizationの両方を自動化できるか?
  • RQ2各層のスパarsityと量子化ビット幅を同時に学習できる制約付き最適化フレームワークをどのように設計できるか?
  • RQ3固定されたモデルサイズ予算下で、精度劣化なしに達成可能な最大圧縮比は何か?
  • RQ4提案手法は、先行研究と比較して、各層にどのように圧縮リソース(スパarsityとビット幅)を割り当てているか?
  • RQ5フレームワークは、モデル精度を維持しながら、最先端の圧縮パフォーマンスを達成できるか?

主な発見

  • 提案手法は、CIFAR-10でResNet-50に対して836×の圧縮を達成し、精度に損失なしで、先行する自動化手法を上回る。
  • AlexNetでは、ImageNetで205×の圧縮を達成し、精度に損失なしで、優れた一般化性能を示した。
  • フレームワークは、圧縮比の手動チューニングや追加のハイパーパrameterを一切必要とせず、エンドツーエンドの圧縮を可能にした。
  • 可視化結果から、本手法はスパースな層に高いビット幅を優先的に割り当てており、スパースな重みがより情報量が多いという直感と整合的である。
  • 本手法は、スパarsityと量子化を共同で最適化することで、pruningのみまたはquantizationのみのベースラインよりも高い圧縮比を達成した。
  • ADMMに基づくソリューションは安定的かつ効率的に収束し、強化学習やベイズ最適化などのブラックボックス手法に比べ、不安定さや非効率性を回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。