[論文レビュー] LRP-QViT: Mixed-Precision Vision Transformer Quantization via Layer-wise Relevance Propagation
LRP-QViT は、各層の重要度に基づいてビット割り当てを決定する Layer-wise Relevance Propagation (LRP) を用いた、混合精度後学習量子化手法を提案する。これにより、固定ビット幅法や先行する混合精度手法よりも高い精度が達成される。また、層間変動を低減するため、LayerNorm 後の活性化値に対してクリッピング付きチャネル単位の量子化を導入し、ViT、DeiT、Swin モデルにおいて 4 ビットおよび 6 ビット量子化レベルで最先端の性能を達成する。
Vision transformers (ViTs) have demonstrated remarkable performance across various visual tasks. However, ViT models suffer from substantial computational and memory requirements, making it challenging to deploy them on resource-constrained platforms. Quantization is a popular approach for reducing model size, but most studies mainly focus on equal bit-width quantization for the entire network, resulting in sub-optimal solutions. While there are few works on mixed precision quantization (MPQ) for ViTs, they typically rely on search space-based methods or employ mixed precision arbitrarily. In this paper, we introduce LRP-QViT, an explainability-based method for assigning mixed-precision bit allocations to different layers based on their importance during classification. Specifically, to measure the contribution score of each layer in predicting the target class, we employ the Layer-wise Relevance Propagation (LRP) method. LRP assigns local relevance at the output layer and propagates it through all layers, distributing the relevance until it reaches the input layers. These relevance scores serve as indicators for computing the layer contribution score. Additionally, we have introduced a clipped channel-wise quantization aimed at eliminating outliers from post-LayerNorm activations to alleviate severe inter-channel variations. To validate and assess our approach, we employ LRP-QViT across ViT, DeiT, and Swin transformer models on various datasets. Our experimental findings demonstrate that both our fixed-bit and mixed-bit post-training quantization methods surpass existing models in the context of 4-bit and 6-bit quantization.
研究の動機と目的
- Vision Transformer における等ビット幅量子化の性能劣化を是正するため、層の重要度に基づく混合精度量子化を可能にする。
- 層間変動に起因する LayerNorm 後の活性化における性能劣化を、新規のクリッピング機構により低減する。
- 再訓練を必要とせず、高い精度を維持する効率的な後学習量子化フレームワークを構築する。
- 画像分類、検出、セグメンテーションのベンチマークにおいて、既存の固定ビット幅法および混合精度手法よりも優れた性能を示す。
提案手法
- LRP を用いて、出力から各層へ relevance を逆伝播させることで、分類に与える各層の寄与度スコアを計算し、層の重要度を定量化する。
- 各層のビット割り当ては、LRP で得られた重要度スコアに基づき決定され、より重要な層には高い精度が割り当てられる。
- クリッピング付きチャネル単位の量子化を LayerNorm 後の活性化値に適用し、LayerNorm のアフィン係数とその後続層の重みを調整することで、外れ値を除去する。
- フレームワークは、RepQ-ViT の改良点を統合しており、特に、$\log\sqrt{2}$ 量子化器を SoftMax 後に適用し、推論時に $\log 2$ にリスケーリングする。
- 後学習量子化 (PTQ) に従い、わずかなキャリブレーションデータセット(32 枚)と微調整を一切不要とする。
- LRP で特定された重要度の低い層に対してビット数を削減することで、混合精度ビット割り当てを最適化し、平均ビット幅制約を満たす。
実験結果
リサーチクエスチョン
- RQ1LRP を用いて導出された層の重要度スコアは、Vision Transformer における混合精度ビット割り当ての指針として効果的に機能するか?
- RQ2LayerNorm 後の活性化値に適用するクリッピング付きチャネル単位の量子化は、層間変動に起因する性能劣化を緩和するか?
- RQ34 ビットおよび 6 ビットの低ビット幅において、LRP-QViT は固定ビット幅法および既存の混合精度量子化手法と比較して、精度と効率の面で優れているか?
- RQ4提案手法は、ViT、DeiT、Swin といった多様な Vision Transformer アーキテクチャおよび分類、検出、セグメンテーションといった多様なタスクにおいて、高い性能を維持できるか?
- RQ5提案された PTQ フレームワークにおいて、キャリブレーションデータサイズ、推論時間、精度のトレードオフは何か?
主な発見
- Swin-S を用いた ImageNet-1K では、32 ビットキャリブレーションと 32 枚のサンプルを用いて 81.37% のトップ-1 精度を達成し、同じビット幅で RepQ-ViT (80.55%) や CRL-QViT (80.55%) を上回る。
- DeiT-S を 4 ビットで量子化した場合、最初の 2 ブロックに 5 ビットを割り当て、残りに 4 ビットを割り当てた結果、均一な 4 ビット量子化の 70.78% よりも高い 75.66% の精度を達成した。
- クリッピング付きチャネル単位の量子化は、標準的なチャネル単位の量子化よりも 0.5%、層単位の量子化よりも 1.7% の精度向上をもたらした。
- LRP-QViT は、分類、検出、セグメンテーションのタスクにおいて、ViT、DeiT、Swin モデルの 4 ビットおよび 6 ビットの後学習量子化で最先端の性能を達成した。
- キャリブレーションに必要な画像は 32 枚のみで、FQViT(再構成不要)と同等のキャリブレーション時間を要しながら、4 ビット量子化においては 0.10% の精度向上(FQViT は 1.1% の向上)を達成した。
- アブレーションスタディにより、ViT ベースのモデルでは最初の 2 ブロックが最も重要であり、LRP を用いたプルーニングにより重要度の低い層のビット数を削減することで、モデルサイズを維持しつつ性能を向上させられることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。