Skip to main content
QUICK REVIEW

[論文レビュー] Generative Low-bitwidth Data Free Quantization

Shoukai Xu, Haokun Li|arXiv (Cornell University)|Mar 7, 2020
Advanced Neural Network Applications参考文献 54被引用数 14
ひとこと要約

本稿では、実際のトレーニングデータを必要とせずに4ビットニューラルネットワークの量子化を実現する新規手法、Generative Low-bitwidth Data Free Quantization (GDFQ) を提案する。事前に訓練されたモデルのバッチ正規化統計から得られる分類境界および活性化分布の知識を活用し、高品質な偽データを合成する知識マッチングジェネレータを訓練することで、有効な量子化とファインチューニングを可能にする。本手法は4ビット量子化において最先端の精度を達成し、ZeroQ や DFQ といった既存のデータフリー手法を著しく上回る性能を発揮する。

ABSTRACT

Neural network quantization is an effective way to compress deep models and improve their execution latency and energy efficiency, so that they can be deployed on mobile or embedded devices. Existing quantization methods require original data for calibration or fine-tuning to get better performance. However, in many real-world scenarios, the data may not be available due to confidential or private issues, thereby making existing quantization methods not applicable. Moreover, due to the absence of original data, the recently developed generative adversarial networks (GANs) cannot be applied to generate data. Although the full-precision model may contain rich data information, such information alone is hard to exploit for recovering the original data or generating new meaningful data. In this paper, we investigate a simple-yet-effective method called Generative Low-bitwidth Data Free Quantization (GDFQ) to remove the data dependence burden. Specifically, we propose a knowledge matching generator to produce meaningful fake data by exploiting classification boundary knowledge and distribution information in the pre-trained model. With the help of generated data, we can quantize a model by learning knowledge from the pre-trained model. Extensive experiments on three data sets demonstrate the effectiveness of our method. More critically, our method achieves much higher accuracy on 4-bit quantization than the existing data free quantization method. Code is available at https://github.com/xushoukai/GDFQ.

研究の動機と目的

  • 実際のトレーニングデータが入手不可能なデータ不足またはプライバシー制約のある環境における低ビット幅モデルの量子化の課題に対処すること。
  • トレーニング後の量子化におけるキャリブレーションやファインチューニングに実データに依存しない手法を開発すること。
  • 特に分類境界と活性化分布を含む、事前学習モデルに埋め込まれた隠れた知識を活用して意味のある合成データを生成すること。
  • 既存のデータフリー量子化手法と比較して、4ビット精度において優れた量子化精度を達成すること。

提案手法

  • バッチ正規化統計(BNS)から抽出した分類境界および活性化分布の情報を基に、知識マッチングジェネレータを訓練し、偽データを生成する。
  • 生成されたサンプル上で全精度モデルの分類精度を最大化するようにジェネレータを最適化することで、意味的関連性と分布の正確性を保証する。
  • 生成された偽データを用いて量子化モデルをファインチューニングし、ジェネレータと量子化モデルの交互学習により、データの多様性とモデル性能を向上させる。
  • 分類精度のしきい値に基づく停止条件を用いてジェネレータの学習期間を制御し、アブレーションにより長時間の学習が結果を改善することが示された。
  • 2段階の損失関数を用いる:1つは偽データとBNSとの一致を図る知識マッチング用損失、もう1つは生成データに対するクロスエントロピー損失によるモデルファインチューニング用損失。
  • エンドツーエンドのアプローチを採用:偽データを生成 → モデルを量子化 → 生成データを用いてファインチューニング、すべての段階で実データにアクセスしない。

実験結果

リサーチクエスチョン

  • RQ1実際のトレーニングデータにアクセスできない状況下で、高品質で意味的関連性を持つデータを生成するジェネレータを訓練可能か?
  • RQ2バッチ正規化統計から得られる分類境界および活性化分布の知識を、データフリー量子化におけるデータ生成を効果的にガイドするために活用可能か?
  • RQ3ジェネレータと量子化モデルの交互学習は、分離して学習する場合と比較して、量子化精度を向上させるか?
  • RQ4特に4ビットにおいて、ビット幅が減少するに従ってデータフリー量子化の性能はどのように変化するか?
  • RQ5提案手法は、ZeroQ や DFQ といった既存のデータフリー量子化ベースラインを、低ビット幅環境下で上回ることができるか?

主な発見

  • ImageNet において、ResNet-50 の W4A4 量子化で 55.65% のトップ1精度を達成し、ZeroQ の 0.12% や DFQ の 0.11% を著しく上回った。
  • MobileNetV2 では、4ビットで 51.30% のトップ1精度を達成し、ZeroQ の 3.31% や DFQ の 0.11% と比較して顕著な性能向上を示した。
  • ジェネレータと量子化モデルの交互学習では 63.91% の精度を達成し、分離学習(61.81%)を上回ったことから、共同最適化の有効性が示された。
  • 生成器の学習を早期に停止(例:99% のしきい値で)すると、最適でない結果となる。最良の性能は収束まで学習を継続した場合に得られた。
  • 本手法は4ビット量子化において最先端の性能を達成し、データフリー低ビット幅量子化分野における新たなSOTAを確立した。
  • 性能向上は特に低ビット幅で顕著であり、GDFQ は4ビットにおいてベースラインと比較してより大きな向上を示したが、6ビットや8ビットではその差が小さい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。