Skip to main content
QUICK REVIEW

[論文レビュー] Q-ViT: Fully Differentiable Quantization for Vision Transformer

Zhexin Li, Tong Yang|arXiv (Cornell University)|Jan 19, 2022
CCD and CMOS Imaging SensorsEngineering被引用数 17
ひとこと要約

Q-ViT は、視覚変換器(ViT)における完全微分可能な量子化手法を提案する。この手法は、最適な量子化スケールとビット幅を同時に学習し、ヘッド単位のビット幅割り当てとスイッチ可能なスケール技術を用いて学習の安定化を図る。3ビット量子化において最先端の性能を達成し、DeiT-Tiny では均一量子化よりも1.5%高い精度を実現し、精度の低下を最小限に抑える。

ABSTRACT

In this paper, we propose a fully differentiable quantization method for vision transformer (ViT) named as Q-ViT, in which both of the quantization scales and bit-widths are learnable parameters. Specifically, based on our observation that heads in ViT display different quantization robustness, we leverage head-wise bit-width to squeeze the size of Q-ViT while preserving performance. In addition, we propose a novel technique named switchable scale to resolve the convergence problem in the joint training of quantization scales and bit-widths. In this way, Q-ViT pushes the limits of ViT quantization to 3-bit without heavy performance drop. Moreover, we analyze the quantization robustness of every architecture component of ViT and show that the Multi-head Self-Attention (MSA) and the Gaussian Error Linear Units (GELU) are the key aspects for ViT quantization. This study provides some insights for further research about ViT quantization. Extensive experiments on different ViT models, such as DeiT and Swin Transformer show the effectiveness of our quantization method. In particular, our method outperforms the state-of-the-art uniform quantization method by 1.5% on DeiT-Tiny.

研究の動機と目的

  • 3ビット未満の低ビット量子化において顕著な精度低下を示す現在の手法の課題に取り組むこと。
  • ViT におけるコンponentレベルの量子化耐性を調査し、感受性の高いレイヤーやコンponentを同定すること。
  • モデルサイズと精度制約の下で、量子化スケールとビット幅を同時に最適化する完全微分可能な量子化フレームワークを開発すること。
  • 特にマルチヘッド自己注意(MSA)とGELUレイヤーに特化した、ViTのアーキテクチャ的特徴に適合した混合精度量子化を可能にすること。
  • 3ビット精度で安定した学習と高い性能を達成し、ViTの量子化の限界を押し広げること。

提案手法

  • 量子化スケールとビット幅の両方が微分可能で学習可能なパラメータである、完全微分可能な量子化フレームワークを導入する。
  • ヘッド単位のビット幅割り当てを提案し、MSA内の個々の注意ヘッドが量子化に対する耐性に応じて異なるビット幅を学習可能にする。
  • スケールとビット幅の共同最適化を安定化させるためのスイッチ可能なスケール機構を設計し、学習中の収束問題を解消する。
  • 実証的耐性分析に基づき、特にGELUや特定のMSAヘッドといった感受性の高いコンponentに高いビット幅を割り当てることで、混合精度量子化を実装する。
  • 精度と計算制約(BitOPs)のバランスを取るために正則化項を含む最適化目的関数を定式化する。
  • 訓練中に均一なビット幅から学習されたビット幅へ段階的に移行する温度制御戦略(σ)を用い、最適化の安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1視覚変換器におけるどのコンponentが量子化ノイズに対して最も感受性が高く、その耐性はレイヤーやヘッドごとにどのように変動するか?
  • RQ2微分可能でエンドツーエンドの訓練アプローチを用いることで、スケールとビット幅の共同最適化がViTで安定化可能か?
  • RQ3ヘッド単位のビット幅割り当ては、均一ビット幅と比較して低ビットViT量子化における性能向上に寄与するか?
  • RQ43ビット量子化されたViTは、顕著な性能低下を伴わずに競争力のある精度を達成できるか?
  • RQ5スイッチ可能なスケール機構は、混合精度ViT量子化における収束性と性能向上にどのように寄与するか?

主な発見

  • GELU活性化レイヤーは、長尾分布を示すため、安定した性能を維持するには高いビット幅が必要である。
  • MSA内の異なる注意ヘッドは、量子化に対する耐性に顕著な差を示し、一部のヘッド(例:DeiT-Small におけるインデックス1および2)は2ビットに量子化すると顕著な精度低下を引き起こす。
  • Q-ViT は、DeiT-Tiny を3ビットで量子化した際、ImageNet でトップ1精度69.15%を達成し、最先端の均一量子化手法LSQ+を1.5%上回る。
  • スイッチ可能なスケール技術は収束に不可欠である:この技術を用いないと、3ビットおよび4ビット設定において均一量子化よりも性能が劣る。
  • ヘッド単位のビット幅割り当てにより、ViTのあらゆるバージョンで0.5%の性能向上が達成され、ヘッドごとの精度適合の重要性が示された。
  • GELUレイヤーは3ビット制約下でも常に高いビット幅(通常≥4ビット)を学習する傾向があり、感受性の高さと適応的割り当ての有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。