Skip to main content
QUICK REVIEW

[論文レビュー] Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling

Xiuying Wei, Yuncheng Zhang|arXiv (Cornell University)|Apr 18, 2023
Topic Modeling被引用数 6
ひとこと要約

Outlier Suppression+ (OS+) は、大規模言語モデルの事後訓練量子化のための新規フレームワークを提案する。このフレームワークでは、活性化における非対称的かつ集中的である外れ値を抑えるためにチャネル単位のシフトとスケーリングを用いる。これらの操作を後続層に等価に移行させ、出力の変化を最小限に抑えるようにシフト/スケール値を最適化することで、8ビットおよび6ビットで浮動小数点に近い性能を達成し、4ビット BERT では15.5% の精度向上を達成し、新たなSOTAを樹立した。

ABSTRACT

Post-training quantization~(PTQ) of transformer language models faces significant challenges due to the existence of detrimental outliers in activations. We observe that these outliers are concentrated in specific channels and are asymmetric across channels. To address this issue, we propose the Outlier Suppression+~(OS+) framework, which contains the channel-wise shifting for asymmetry and channel-wise scaling for concentration. We show that these operations can be seamlessly migrated into subsequent modules while maintaining equivalence. Second, we propose a fast and stable scheme to calculate effective shifting and scaling values. The channel-wise shifting aligns the center of each channel for removal of outlier asymmetry. The channel-wise scaling quantitatively evaluates changes brought by migration and quantization for better quantization burden balance. We validate our OS+ under both standard and fine-grained quantization settings with models including BERT, OPT, BLOOM, BLOOMZ, and LLaMA. Comprehensive results across various tasks demonstrate the superiority of our approach. Especially, with standard quantization, OS+ can achieve near-floating-point performance on both small models and large language models on 8-bit and 6-bit. Besides, we establish a new state-of-the-art for 4-bit BERT with 15.5\% improvement. Our code is available at \url{https://github.com/ModelTC/Outlier_Suppression_Plus}.

研究の動機と目的

  • 大規模言語モデルの事後訓練量子化における悪影響を及える外れ値の課題に対処すること。
  • これまで無視されてきた特徴:チャネル間での非対称的外れ値分布を特定し、活用すること。
  • 最適化されたシフトとスケーリングを通じて、完全精度の同等性を維持しつつ量子化誤差を最小限に抑える手法を開発すること。
  • 追加のトレーニングや推論のオーバーヘッドなしに、効率的でハードウェアフレンドリーな量子化を可能にすること。
  • 多様な大規模言語モデルにおいて、標準的および細分化された量子化設定で、幅広いビット幅で最先端の性能を達成すること。

提案手法

  • チャネル単位のシフトを導入し、チャネル間での外れ値分布の非対称性を解消し、全体のテンソル範囲を縮小する。
  • チャネル単位のスケーリングを適用し、極端な外れ値の値を集中・抑制することで、量子化への影響を最小限に抑える。
  • シフトおよびスケーリングの効果を後続層に移行させる統一された移行パターンを設計し、完全精度のモデル出力を維持する。
  • 出力変化を最小化することを目的とした、安定で高速な最適化手法を提案し、活性化または重みの量子化誤差の最小化ではなく、出力変化を基準とする。
  • 量子化負荷を層間でバランスさせる定量的目的関数を設計し、エンドツーエンドの出力偏差を最小限に抑える。
  • パラメータの更新を前層に適用することで変換を実装し、追加の計算や再トレーニングなしにデプロイを可能にする。

実験結果

リサーチクエスチョン

  • RQ1なぜトランスフォーマーの活性化における外れ値が、事後訓練量子化において顕著な性能低下を引き起こすのか?
  • RQ2チャネル間での非対称的外れ値分布を体系的にどのように是正すれば、量子化精度を向上させられるか?
  • RQ3シフトとスケーリング操作を、完全精度の同等性を保ちつつ量子化誤差を低減する方法で適用可能か?
  • RQ4シフトおよびスケール値の最適化戦略として、量子化モデルにおけるエンドツーエンドの出力変化を最小限に抑えるものは何か?
  • RQ5この手法は、4ビット、6ビット、8ビットのような低ビット幅において、多様な大規模言語モデルで最先端の性能を達成できるか?

主な発見

  • OS+ は、8ビットおよび6ビット量子化において、小規模および大規模言語モデルで浮動小数点に近い性能を達成し、精度の低下を最小限に抑えた。
  • 4ビット BERT において、OS+ は従来手法よりも15.5% の精度向上を達成し、新たなSOTAを樹立した。
  • この手法は、テストされた層における出力量子化誤差を1334.89にまで低減した。これは、OS (6182.52) や SQ (3535.86) よりも顕著に低い値である。
  • OPT-175B のキャリブレーションに要する時間は約20分で、実用的な効率性を示した。
  • 推論遅延は最大1.5倍まで向上し、デプロイドモデルでは追加の計算オーバーヘッドが生じなかった。
  • ストレージ制約が固定された条件下で、量子化された大規模モデルが、FP16の小規模モデルを上回る性能を示した。これは、本手法の頑健性とスケーラビリティを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。