[論文レビュー] Quantization Variation: A New Perspective on Training Transformers with Low-Bit Precision
本稿は、低ビット量正確トレーニング(QAT)におけるパラメータのフラクチュエーション(変動)によって引き起こされるトレーニング不安定性を解消する、ビジョントランスフォーマー(ViTs)向けのバリエーションに配慮した量子化フレームワークを提案する。マルチクロップ知識蒸留、モジュール依存スケーリング、およびオシレート感度のあるビン正則化を採用することで、トレーニングの安定化を実現し、2ビットのSwin-TでImageNet-1Kで77.66%のTop-1精度を達成。これは先行SOTAを3.35%上回る性能を発揮した。
Despite the outstanding performance of transformers in both language and vision tasks, the expanding computation and model size have increased the demand for efficient deployment. To address the heavy computation and parameter drawbacks, quantization is frequently studied in the community as a representative model compression technique and has seen extensive use on ConvNets. However, due to the unique properties of transformers, the low-bit quantization applications are still limited and underexplored. In this paper, we identify the difficulty of transformer low-bit quantization-aware training on its unique variation behaviors, which significantly differ from ConvNets. Based on comprehensive quantitative analysis, we observe variation in three hierarchies: various module quantization sensitivities, outliers in static weight and activation distribution, and oscillation in dynamic parameter fluctuations. These variations of transformers bring instability to the quantization-aware training (QAT) and negatively influence the performance. We explore the best practices to alleviate the variation's influence during low-bit transformer QAT and propose a variation-aware quantization scheme for both vision and language transformers. We extensively verify and show our scheme can alleviate the variation and improve the performance of transformers across various models and tasks. Our solution substantially improves the 2-bit Swin-T and binary BERT-base, achieving a 3.35% and 1.4% accuracy improvement over previous state-of-the-art methods on ImageNet-1K and GLUE. Codes and models are available at https://github.com/HuangOwen/Quantization-Variation.
研究の動機と目的
- 低ビット量子化されたビジョントランスフォーマーにおけるトレーニング不安定性の根本的要因を特定・解消すること。
- CNNとは異なる、ViTに特有の変動行動を分析し、量子化性能を阻害する要因を特定すること。
- 極めて低いビット幅(2〜4ビット)におけるViTの量子化認識トレーニング(QAT)の効率性と安定性を向上させること。
- モジュールに応じたスケーリングとバリエーション耐性を持つ量子化フレームワークを構築し、収束性と精度を向上させること。
- 2ビットViTモデルを用いて、ImageNet-1Kで最先端の性能を示すこと。
提案手法
- ミニバッチ内のデータ分散を低減するためのマルチクロップ知識蒸留スキームを導入し、QATの安定化と高速化を実現。
- 異なるモジュールごとに異なるスケーリング係数を適用するモジュール依存スケーリング戦略を提案。
- 正則化係数をコサインスケジュールで動的に調整することで、重みのオシレートを低減する「オシレート感度ビン正則化」(OBR)を設計。
- トレーニング中の不安定な重み更新を抑制するためのバリエーションに配慮した正則化項を導入し、収束性を向上。
- LSQ+をベースとした微分可能な量子化スキームを採用し、勾配スケーリングと分布に配慮した正規化を強化。
- 注意マップの可視化により、量子化モデルが特に2ビット精度でも表現能力を保持していることを検証。
実験結果
リサーチクエスチョン
- RQ1なぜビジョントランスフォーマーはCNNと比較して低ビット量子化下で性能が劣るのか?
- RQ2ViTの量子化認識トレーニングにおいて、なぜトレーニング不安定性が生じるのか?
- RQ3ViTにおけるパラメータの変動は、QAT中の重みのオシレートと収束性にどのように影響を与えるか?
- RQ4知識蒸留とモジュール固有のスケーリングは、低ビットViT量子化の安定性と精度を向上させ得るか?
- RQ5オシレート感度正則化は、低ビットViTトレーニングにおける重みのオシレートをどれほど抑制し、モデル精度を向上させ得るか?
主な発見
- 提案手法は、2ビットのSwin-Tを用いてImageNet-1Kで77.66%のTop-1精度を達成し、前回SOTAを3.35%上回った。
- オシレート感度ビン正則化(OBR)により、トレーニング終了時のオシレート重みの割合がベースラインの7.33%から0.23%に低下し、精度向上と相関した。
- マルチクロップ知識蒸留によりトレーニングが安定化し、データ分散が低減され、収束が速くなり、精度が向上した。
- 提案手法の損失ランドスケープは、ベースラインと比較して滑らかで中心に寄った形状を示し、トレーニング安定性の向上を示した。
- 注意マップの可視化により、2ビット量子化されたSwin-Tが顕著なオブジェクトに強い注目を示しているのに対し、ベースラインは均一な注目を示すのと対照的であった。
- 本手法は、2〜4ビット精度において複数のViTアーキテクチャ(DeiT-T, SReT-T, Swin-T)で最先端の性能を達成し、一般化性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。