Skip to main content
QUICK REVIEW

[論文レビュー] PD-Quant: Post-Training Quantization based on Prediction Difference Metric

Jiawei Liu, Lin Niu|arXiv (Cornell University)|Dec 14, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

PD-Quantは、予測差分(具体的には、フルプレシジョンモデルと量子化モデル出力間のKLダイバージェンス)を用いて量子化パラメータを最適化することで、低ビットモデルの精度を向上させるポストトレーニング量子化手法を提案する。分布補正(Distribution Correction)を導入し、小規模なキャリブレーションデータセットにおける過学習を軽減。その結果、ResNet-18の2ビット重み・活性化設定で53.14%のトップ1精度という最先端の結果を達成。

ABSTRACT

Post-training quantization (PTQ) is a neural network compression technique that converts a full-precision model into a quantized model using lower-precision data types. Although it can help reduce the size and computational cost of deep neural networks, it can also introduce quantization noise and reduce prediction accuracy, especially in extremely low-bit settings. How to determine the appropriate quantization parameters (e.g., scaling factors and rounding of weights) is the main problem facing now. Existing methods attempt to determine these parameters by minimize the distance between features before and after quantization, but such an approach only considers local information and may not result in the most optimal quantization parameters. We analyze this issue and ropose PD-Quant, a method that addresses this limitation by considering global information. It determines the quantization parameters by using the information of differences between network prediction before and after quantization. In addition, PD-Quant can alleviate the overfitting problem in PTQ caused by the small number of calibration sets by adjusting the distribution of activations. Experiments show that PD-Quant leads to better quantization parameters and improves the prediction accuracy of quantized models, especially in low-bit settings. For example, PD-Quant pushes the accuracy of ResNet-18 up to 53.14% and RegNetX-600MF up to 40.67% in weight 2-bit activation 2-bit. The code is released at https://github.com/hustvl/PD-Quant.

研究の動機と目的

  • 極めて低いビット幅(特に2ビット)におけるポストトレーニング量子化(PTQ)の性能低下を是正すること。特に、量子化ノイズが精度に顕著に影響を与える状況を想定。
  • 局所的指標(例:MSE やコサイン距離)による最適な量子化スケーリング要因や丸め値の選定に起因する制限を克服すること。
  • キャリブレーションデータが限られている場合に生じるPTQにおける過学習を軽減するため、活性化分布をバッチ正規化層に保持された統計と一致させる補正を実施すること。
  • 局所的特徴再構成ではなく、モデルの予測差分というグローバル情報に基づいて量子化パラメータを最適化する手法を開発すること。

提案手法

  • PD-Quantは、フルプレシジョンモデルと量子化モデルの最終出力間のKLダイバージェンスを主な指標として用い、量子化パラメータの最適化を誘導する。
  • 予測差分損失を最小化することで、活性化スケーリング要因と重み丸め値を同時に最適化し、局所的特徴のずれではなくグローバルなモデル挙動を捉える。
  • 分布補正(DC)を導入し、キャリブレーションデータセットの活性化の平均と分散をバッチ正規化層に保存された統計と一致させる。これにより一般化性能が向上する。
  • スケーリング要因と丸め値の微分可能探索戦略を用いて、層ごとに最適化を実施し、特に低ビット設定に焦点を当てる。
  • 再トレーニングを必要とせず、少量のラベルなしキャリブレーションサンプルのみに依存して、トレーニング後処理として適用可能。
  • 評価はResNet-18、RegNetX-600MF、MobileNetV2で実施し、モデルやビット幅にかかわらず一貫した性能向上が確認された。

実験結果

リサーチクエスチョン

  • RQ1フルプレシジョンモデルと量子化モデル出力間のKLダイバージェンスで測定される予測差分は、MSE やコサイン距離といった局所的指標よりも優れた量子化パラメータを導くことができるか?
  • RQ2グローバルな予測差分情報を利用することで、特に2ビットのような低ビット設定において、量子化精度が向上するか?
  • RQ3限られたキャリブレーションデータを用いたPTQにおいて、キャリブレーションデータセットの活性化分布を補正することで過学習が軽減されるか?
  • RQ4低ビット幅における既存のPTQベースラインと比較して、提案手法の精度と計算コストの両面で優位性を示せるか?

主な発見

  • ResNet-18において2ビット重み・2ビット活性化を適用した場合、ImageNetで53.14%のトップ1精度を達成し、この設定におけるPTQの新たな最先端を樹立した。
  • RegNetX-600MFでも、同じ2ビット設定下で40.67%のトップ1精度を達成し、従来のPTQ手法を大きく上回った。
  • KLダイバージェンスによる予測差分を最適化目的関数に用いることで、MSE やコサイン距離といった局所的指標よりも精度の高い量子化パラメータが得られた。
  • 分布補正(DC)により、一般化性能が向上し、過学習が軽減された。λcの値が異なる条件でも安定した性能を示し、ハイパーパramータのチューニングが最小限で済んだ。
  • PD-Quantの追加推論時間コストは許容範囲内であり、ResNet-18ではRTX A6000で1.11時間にとどまり、LSQなどのQAT手法の120時間と比較して顕著に短い。
  • 本手法は低ビット重み量子化に対して頑健であるが、重みスケーリング要因の向上は限定的であり、活性化量子化が予測に基づく最適化に対してより感受性が高いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。