Skip to main content
QUICK REVIEW

[論文レビュー] Focused Quantization for Sparse CNNs

Yiren Zhao, Xitong Gao|arXiv (Cornell University)|Jan 1, 2019
Advanced Neural Network Applications被引用数 11
ひとこと要約

本稿では、スパース畳み込みニューラルネットワーク向けに動的にシフト量子化とリセンター化量子化を組み合わせるハイブリッド量子化手法であるフォーカスド・クオンタイゼーション(FQ)を提案する。プルーニング後の層固有の重み分布の統計的性質を活用することで、FQは高い圧縮比(ResNet-50では18.08倍)を達成しつつ、最小限の精度損失(トップ5精度が0.24%低下)を実現し、ビットシフト演算とハードウェアリource使用量の削減により、効率的な推論を可能にする。

ABSTRACT

Deep convolutional neural networks (CNNs) are powerful tools for a wide range of vision tasks, but the enormous amount of memory and compute resources required by CNNs pose a challenge in deploying them on constrained devices. Existing compression techniques, while excelling at reducing model sizes, struggle to be computationally friendly. In this paper, we attend to the statistical properties of sparse CNNs and present focused quantization, a novel quantization strategy based on power-of-two values, which exploits the weight distributions after fine-grained pruning. The proposed method dynamically discovers the most effective numerical representation for weights in layers with varying sparsities, significantly reducing model sizes. Multiplications in quantized CNNs are replaced with much cheaper bit-shift operations for efficient inference. Coupled with lossless encoding, we built a compression pipeline that provides CNNs with high compression ratios (CR), low computation cost and minimal loss in accuracy. In ResNet-50, we achieved a 18.08x CR with only 0.24% loss in top-5 accuracy, outperforming existing compression methods. We fully compressed a ResNet-18 and found that it is not only higher in CR and top-5 accuracy, but also more hardware efficient as it requires fewer logic gates to implement when compared to other state-of-the-art quantization methods assuming the same throughput.

研究の動機と目的

  • 細かくプルーニングされた後、非一様な重み分布を示すスパースCNNにおける、標準的量子化の非効率性に対処するため、均一または対数的量子化レベルが非効率に利用される問題を解決すること。
  • 層ごとのスパースリティレベルの変動に適応できる量子化戦略を開発し、量子化レベルの利用度を最大化するとともに、計算オーバーヘッドを最小限に抑えること。
  • プルーニング、フォーカスド・クオンタイゼーション、および無損失符号化を統合した包括的な圧縮パイプラインを構築し、高い圧縮比と低コストのハードウェア実装を実現すること。
  • FQが最先端の量子化手法よりも効率的なハードウェア実装を可能にすることを示し、必要な論理ゲート数を減らし、リソース使用量を低減すること。

提案手法

  • FQは、プルーニングされた層の重み分布における高確率領域を特定するためにガウス・ミックスチャネル・モデルを用いる。
  • 複数の集中した重みクラスタを有する層に対しては、リセンター化量子化を適用し、各クラスタを2の累乗値の集合にマッピングして、細かく表現する。
  • 単一の主要な重みクラスタを有する層に対しては、2の累乗値を用いたシフト量子化を適用し、推論時に効率的なビットシフト演算を可能にする。
  • ガウス成分間のワーサインシュタイン距離を用いて、各層でリセンター化量子化かシフト量子化かを決定する。実験では、wsep = 2.0の閾値が用いられている。
  • 推論時にスケーリング要因をバッチ正規化層に統合し、追加の乗算を排除することで、ハードウェアの複雑さを低減する。
  • 完全なパイプラインには、細かくプルーニング、FQ、およびハフマン符号化が含まれており、精度の著しい低下を抑えて高い圧縮比を達成する。

実験結果

リサーチクエスチョン

  • RQ1細かくプルーニングされた後、非一様で歪んだ重み分布を示すスパースCNNにおいて、どのようにして量子化をより効果的にすることができるか?
  • RQ2シフト量子化とリセンター化量子化を組み合わせたハイブリッド量子化戦略は、圧縮効率とハードウェアコストの面で、標準的量子化を上回ることができるか?
  • RQ3層固有のスパースリティと重み分布に基づいて、シフト量子化とリセンター化量子化の切り替えを信頼性高く判断するための指標として、どのような指標が適しているか?
  • RQ4フォーカスド・クオンタイゼーションは、現代のCNNにおいて、モデルサイズと計算コストをどの程度削減しつつ、モデル精度を保持できるか?
  • RQ5論理ゲート使用量とリソース効率の観点から、FQを用いたハードウェア設計は、最先端の量子化手法と比較して、どのように優れているか?

主な発見

  • ResNet-50では、フォーカスド・クオンタイゼーションにより18.08倍の圧縮比が達成され、トップ5精度はわずか0.24%低下した。これは、既存手法を上回る性能を示した。
  • FQを用いた完全量子化されたResNet-18モデルは、LQ-Net や ABC-Net よりも高い圧縮比とより良いトップ5精度を達成したが、必要な論理ゲート数は少なく抑えられた。
  • FQを用いたハードウェアアクセラレータは、より多くの量子化レベルと高い圧縮比を有しながらも、ABC-Net や LQ-Net よりも少ない論理ゲート数で実現され、優れたハードウェア効率を示した。
  • ワーサインシュタイン距離の閾値(wsep = 2.0)を用いることで、リセンター化量子化とシフト量子化の切り替えを効果的に分類でき、量子化の利用度が向上した。
  • プルーニング、量子化、およびハフマン符号化を含むFQパイプラインは、精度の著しい低下を抑えながら高い圧縮を実現し、エッジデバイスやIoTデバイスへの適用に適していた。
  • FQが2の累乗値のみを用いることで、効率的なビットシフト演算が可能になり、推論時の計算コストを顕著に低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。