Skip to main content
QUICK REVIEW

[論文レビュー] Performance Guaranteed Network Acceleration via High-Order Residual Quantization

Zefan Li, Bingbing Ni|arXiv (Cornell University)|Aug 29, 2017
Sparse and Compressive Sensing Techniques参考文献 20被引用数 19
ひとこと要約

本稿では、深層ニューラルネットワークにおける量子化誤差を低減するために、再帰的なしきい値処理を適用する新しい二値近似手法であるHigh-Order Residual Quantization (HORQ) を提案する。複数の二値特徴マップを段階的に低下する大きさのスケールで生成し、高次二値フィルタリングを用いることで、HORQは最小限の精度低下で最大30倍の高速化を達成し、CIFAR-10ではXNOR-Netより約3%、MNISTでは0.71%高い精度を達成しながら、32倍のモデル圧縮を維持する。

ABSTRACT

Input binarization has shown to be an effective way for network acceleration. However, previous binarization scheme could be regarded as simple pixel-wise thresholding operations (i.e., order-one approximation) and suffers a big accuracy loss. In this paper, we propose a highorder binarization scheme, which achieves more accurate approximation while still possesses the advantage of binary operation. In particular, the proposed scheme recursively performs residual quantization and yields a series of binary input images with decreasing magnitude scales. Accordingly, we propose high-order binary filtering and gradient propagation operations for both forward and backward computations. Theoretical analysis shows approximation error guarantee property of proposed method. Extensive experimental results demonstrate that the proposed scheme yields great recognition accuracy while being accelerated.

研究の動機と目的

  • 深層ニューラルネットワークにおける一次二値化によって引き起こされる顕著な精度低下を是正すること。
  • 高い近似精度を維持しながら効率的な二値演算を可能にする二値量子化スキームの開発。
  • 提案された量子化フレームワークに対する理論的誤差保証の提供。
  • CPU上での深層ネットワークの実用的デプロイメントを可能にすること、かつ性能損失を最小限に抑えること。

提案手法

  • 再帰的なしきい値処理を用いて、段階的に低下する大きさのスケールで複数の二値特徴マップを生成するHigh-Order Residual Quantization (HORQ) を提案する。
  • 前方および後方伝搬計算をすべて二値演算で行えるように、高次二値フィルタリングおよび勾配伝搬操作を導入する。
  • 再帰的残差分解を採用する:次数Kにおいて、入力をK個の二値マップと残差の和として近似し、各段階で近似を精緻化する。
  • 近似誤差に関する理論的バウンディングを導出し、量子化次数が増加するにつれて誤差が減少することを示す。
  • 二値重みおよび二値活性化マップを用いることで32倍のモデル圧縮を達成し、現代のCPUでは1サイクルあたり64ビットの二値演算のみで計算を実行可能にする。
  • 標準的な畳み込み層にこの手法を適用し、最終出力は各残差段階の出力の和として得られる。

実験結果

リサーチクエスチョン

  • RQ1再帰的残差量子化は、一次しきい値処理を超えて二値ニューラルネットワークにおける近似誤差を低減できるか?
  • RQ2高次二値演算は、推論における顕著な高速化を実現しながらも高い精度を維持できるか?
  • RQ3提案された高次残差量子化スキームの理論的誤差バウンディングは何か?
  • RQ4フィルターサイズ、チャネル数、および量子化次数と、スループット向上比のスケーリング関係はどのように変化するか?
  • RQ5HORQはXNOR-Netのような既存の二値化手法を、精度および効率の両面で上回ることができるか?

主な発見

  • HORQ-Netは平均して30倍の高速化を達成し、最適条件(64×256チャネル、3×3フィルター)では31.98倍の高速化を達成する。
  • 本手法は理論的誤差保証を提供し、量子化次数が増加するにつれて近似誤差が減少することを示している。
  • CIFAR-10では、HORQ-NetはXNOR-Netよりもトップ-1精度で約3%高い性能を達成する。
  • MNISTでは、HORQ-NetはXNOR-Netよりも0.71%高い精度を達成する。
  • 二値重みを用いることで、約32倍の圧縮比を達成し、ストレージ要件を顕著に削減する。
  • 2次および3次量子化においても、20倍を超える高速化が維持され、実世界のデプロイメントに実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。