[論文レビュー] RepQ-ViT: Scale Reparameterization for Post-Training Quantization of Vision Transformers
RepQ-ViT は、スケール再パラメータ化を用いて、ハードウェア効率とは分離された量子化精度を実現する、ビジョントランスフォーマー向けの新規な事後量子化フレームワークを提案する。初期段階で複雑な量子化器(後処理 LayerNorm のためのチャネル別、後処理 Softmax のための log√2)を適用し、その後それらのスケールをハードウェアに適したレイヤー別および log2 量子化器に再パラメータ化することで、再構築やハイパーパramータチューニングなしに、4ビットでの最先端の精度(例:DeiT-S でトップ1 69.03%)を達成した。
Post-training quantization (PTQ), which only requires a tiny dataset for calibration without end-to-end retraining, is a light and practical model compression technique. Recently, several PTQ schemes for vision transformers (ViTs) have been presented; unfortunately, they typically suffer from non-trivial accuracy degradation, especially in low-bit cases. In this paper, we propose RepQ-ViT, a novel PTQ framework for ViTs based on quantization scale reparameterization, to address the above issues. RepQ-ViT decouples the quantization and inference processes, where the former employs complex quantizers and the latter employs scale-reparameterized simplified quantizers. This ensures both accurate quantization and efficient inference, which distinguishes it from existing approaches that sacrifice quantization performance to meet the target hardware. More specifically, we focus on two components with extreme distributions: post-LayerNorm activations with severe inter-channel variation and post-Softmax activations with power-law features, and initially apply channel-wise quantization and log$\sqrt{2}$ quantization, respectively. Then, we reparameterize the scales to hardware-friendly layer-wise quantization and log2 quantization for inference, with only slight accuracy or computational costs. Extensive experiments are conducted on multiple vision tasks with different model variants, proving that RepQ-ViT, without hyperparameters and expensive reconstruction procedures, can outperform existing strong baselines and encouragingly improve the accuracy of 4-bit PTQ of ViTs to a usable level. Code is available at https://github.com/zkkli/RepQ-ViT.
研究の動機と目的
- ビジョントランスフォーマーの低ビット事後量子化における顕著な精度低下、特に 4 ビット設定での問題に対処すること。
- 既存の ViT 用 PTQ メソッドにおける量子化精度とハードウェア効率のトレードオフを克服すること。
- スケール再パラメータ化を用いて、量子化プロセス(精度のため)と推論(効率のため)を分離すること。
- 明示的なスケール変換を通じて、モデル性能を損なわずにハードウェアに適した推論を可能にすること。
- 最小限のキャリブレーションデータと再訓練なしに、ViT の 4 ビット PTQ で最先端の結果を達成すること。
提案手法
- RepQ-ViT は、キャリブレーション段階で複雑な量子化器を用い、推論段階では簡素化されハードウェアに適した量子化器を用いることで、量子化と推論を分離する。
- チャネル間の変動が大きい後処理 LayerNorm 活性化関数に対しては、初期段階でチャネル別量子化を適用し、その後 LayerNorm のアフィン因子の調整とそれに続くレイヤー重みの変更により、レイヤー別量子化に再パラメータ化する。
- パワーロー分布を示す後処理 Softmax 活性化関数に対しては、初期段階で極端な値をよりよく捉えるために log√2 量子化を用い、その後効率的なビットシフト推論を可能にするために log2 量子化に再パラメータ化する。
- スケール再パラメータ化は、精度を保持しつつ効率的なハードウェア計算を可能にする同等変換によって達成される。
- 本手法はたった 32 サンプルのキャリブレーションデータで十分であり、高価な再構築やハイパーパramータチューニングを回避する。
- フレームワークは理論的に裏付けられており、わずかな精度的または計算的オーバーヘッドで高いロバスト性を維持する。
実験結果
リサーチクエスチョン
- RQ1ビジョントランスフォーマーの事後量子化において、量子化精度とハードウェア効率を分離できるか?
- RQ2顕著な精度損失なしに、複雑な量子化器をハードウェアに適した形に効果的に再パラメータ化できるか?
- RQ3スケール再パラメータ化は、既存の手法と比較して 4 ビット PTQ の性能を向上させるか?
- RQ4log√2 量子化は、log2 量子化と比較して、パワーロー分布を示す注意スコアをよりよく表現できるか?
- RQ5提案手法は最小限のキャリブレーションデータと再訓練なしに最先端の結果を達成できるか?
主な発見
- RepQ-ViT は、4 ビットの重みと活性化で DeiT-S において 69.03% のトップ1精度を達成し、FQ-ViT(0.10%) や PTQ4ViT(34.08%) といった先行手法を顕著に上回った。
- Swin-S においても、RepQ-ViT は 4 ビット PTQ で 79.45% のトップ1精度を達成し、強力なベースラインである PTQ4ViT(76.09%) を上回った。
- 本手法はたった 32 サンプルのキャリブレーションデータで十分であり、PTQ4ViT(32 サンプル) や FQ-ViT(1000 サンプル) と比較してデータ要件を削減しながら、より高い精度を達成した。
- 再パラメータ化により log2 量子化に変換されることで、推論効率が維持され、わずかな計算オーバーヘッドでビットシフト演算が可能になった。
- スケール再パラメータ化プロセスでは、チャネル別量子化と比較してわずか 1.25% の精度低下しか発生せず、ハードウェアに適したレイヤー別量子化を可能にした。
- 本手法はロバストで汎用的であり、ハイパーパラメータチューニングや再構築なしに、複数の ViT バリエーションや視覚タスクで一貫した改善を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。