Skip to main content
QUICK REVIEW

[論文レビュー] Extremely Low Bit Neural Network: Squeeze the Last Bit Out with ADMM

Cong Leng, Hao Li|arXiv (Cornell University)|Jul 24, 2017
Sparse and Compressive Sensing Techniques被引用数 79
ひとこと要約

本論文は、訓練を極端に低ビットなニューラルネットワークとして離散的に制約された問題として定式化し、ADMMで解決している。ImageNetとPascal VOCの複数のアーキテクチャにおいて強力な成果を達成している。

ABSTRACT

Although deep learning models are highly effective for various learning tasks, their high computational costs prohibit the deployment to scenarios where either memory or computational resources are limited. In this paper, we focus on compressing and accelerating deep models with network weights represented by very small numbers of bits, referred to as extremely low bit neural network. We model this problem as a discretely constrained optimization problem. Borrowing the idea from Alternating Direction Method of Multipliers (ADMM), we decouple the continuous parameters from the discrete constraints of network, and cast the original hard problem into several subproblems. We propose to solve these subproblems using extragradient and iterative quantization algorithms that lead to considerably faster convergency compared to conventional optimization methods. Extensive experiments on image recognition and object detection verify that the proposed algorithm is more effective than state-of-the-art approaches when coming to extremely low bit neural network.

研究の動機と目的

  • 深層ネットを非常に低ビット幅へ圧縮する必要性を動機づける。
  • このようなネットの訓練を離散的制約付き最適化問題としてモデル化する(混合整数計画)。
  • ADMMを用いて連続的重みと離散制約を分離し、扱いやすい部分問題を可能にする。
  • 部分問題を効率的に解くために近似(プロキシメタ)および反復量子化のステップを提案する。
  • ImageNetによる画像分類とPascal VOCによる物体検出の複数アーキテクチャを横断して有効性を示す。

提案手法

  • 訓練を min_W f(W) subject to W in the constrained set C(層ごとのスケーリング因子 α_i を用い、重みをゼロと2のべき乗でエンコード)として定式化する。
  • Wと離散的な補助変数 G を W = G で分離し、ADMMを用いて増補ラグランジアンと交互更新を導入する。
  • 収束を加速するために連続的な近傍ステップをエストラグレージェント法で解く。
  • (Q_i, α_i)を反復的に解いて ||V_i - α_i Q_i||^2 を最小化し、Q_i ∈ {0, ±1, ±2, ..., ±2^N} and α_i > 0 を満たす投影ステップを解く。
  • ラグランジュ乗数 λ(縮小された双対変数)によって制約違反を蓄積するデュアル更新を行う。
  • 各層ごとに離散的投影の局所最適解へ収束させるために反復的量子化を適用する。

実験結果

リサーチクエスチョン

  • RQ1ADMMは離散的重み制約と連続最適化を効果的に分離して、極端に低ビットのニューラルネットワークを学習できるか。
  • RQ2提案するADMMベースの手法は、標準のCNNアーキテクチャに対してBinary Weight NetworkやTernary Weight Networkなどの最先端低ビットアプローチと比べてどうか。
  • RQ3極端に低ビット量子化が大規模データセット(ImageNet)や物体検出ベンチマーク(Pascal VOC)に与える性能影響はどうか。
  • RQ4α_iなどの層ごとのスケール因子は最適化と最終精度にどのように影響するか。

主な発見

  • この手法はAlexNetとVGG-16でフル精度と比較して3ビットのみでロスレス圧縮を実現。
  • ResNet-18では、バイナリ量子化はBWNを約4ポイントのトップ-1精度、約3.2ポイントのトップ-5精度で上回り、三値量子化はTWNをそれぞれ約5.2ポイント、3.3ポイント上回る。
  • ResNet-50では、バイナリおよび三値量子化はBWNとTWNを大きく上回り、トップ-1/トップ-5精度で顕著な改善を示す。
  • GoogleNetでは、バイナリと三値量子化はResNetより劣化が大きいが、それでもBWNとTWNを上回り、INT8調整済みの1x1カーネルを含むと結果が改善される。
  • TTNとINQと比較して、提案する三値アプローチはAlexNetとResNet-18で競争力のある、あるいは優れたトップ-1/トップ-5精度を達成(例:TTN: 0.575/0.797; 当方: 0.582/0.806 on AlexNet; TTN: 0.666/0.872; INQ: 0.660/0.871; 当方: 0.670/0.875 on ResNet-18)。
  • 物体検出(Pascal VOC with SSD)において、三値および低ビット量子化はフル精度と比較して競争力のあるmAPを維持し、VGG16+SSDで最小限の損失、Darknet+SSDでは穏やかな損失を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。