Skip to main content
QUICK REVIEW

[論文レビュー] Intriguing Properties of Quantization at Scale

Arash Ahmadian, Saurabh Dash|arXiv (Cornell University)|May 30, 2023
Ferroelectric and Negative Capacitance Devices被引用数 5
ひとこと要約

この論文は、大規模言語モデルにおける量子化由来の性能低下がスケールに起因する必然的な発生的性質ではなく、事前学習中の特定の最適化選択の結果であることを示している。著者らは、重み減衰、勾配クリッピング、精度などのハイパーパrameterを慎重に調整することで、410M~52Bパラメータのモデルを訓練し、単純なINT8事後量子化においてほぼゼロの性能低下(平均0.26%の低下)を達成した。これは、最適化を通じて量子化に強く対応するモデルを体系的に設計可能であることを証明している。

ABSTRACT

Emergent properties have been widely adopted as a term to describe behavior not present in smaller models but observed in larger models. Recent work suggests that the trade-off incurred by quantization is also an emergent property, with sharp drops in performance in models over 6B parameters. In this work, we ask "are quantization cliffs in performance solely a factor of scale?" Against a backdrop of increased research focus on why certain emergent properties surface at scale, this work provides a useful counter-example. We posit that it is possible to optimize for a quantization friendly training recipe that suppresses large activation magnitude outliers. Here, we find that outlier dimensions are not an inherent product of scale, but rather sensitive to the optimization conditions present during pre-training. This both opens up directions for more efficient quantization, and poses the question of whether other emergent properties are inherent or can be altered and conditioned by optimization and architecture design choices. We successfully quantize models ranging in size from 410M to 52B with minimal degradation in performance.

研究の動機と目的

  • 大規模言語モデルにおける量子化による性能低下の崖が、モデルのスケールに起因するものかどうか、最適化の選択に影響を受けるかどうかを調査すること。
  • 大規模モデルが混合精度やファインチューニングを用いずに、単純な事後量子化(PTQ)に inherently より適応可能に訓練できるかどうかを特定すること。
  • 活性化の外れ値を抑制し、量子化の耐性を高めるために、特定の事前学習ハイパーパrameterを同定すること。
  • 410M~52Bパラメータの広範なモデルサイズにわたり、ランダム初期化から量子化に強く対応するモデルを体系的に訓練できることを実証すること。

提案手法

  • 重み減衰、勾配クリッピング、ドロップアウト、混合精度学習を含む最適化ハイパーパrameterを変化させた、制御された大規模な研究が実施された。
  • 著者らは、重み減衰、勾配クリッピング、精度といった重要な学習ハイパーパrameterを体系的に変化させ、410M~52Bパラメータのモデルにおいて、アーキテクチャとデータを一定に保ったまま学習を実施した。
  • 重みと活性化の両方に対して、標準的なINT8量子化を用いた事後量子化(PTQ)を実施し、下流データでのファインチューニングやキャリブレーションは一切行わなかった。
  • 活性化および重みの分布をモデル間で分析し、外れ値の次元を同定し、最適化の選択と相関づけた。
  • 量子化の影響を測定するために、8つのゼロショットNLPベンチマーク(HellaSwag、PIQA、LAMBADA、WinoGradなど)で性能を評価した。
  • 活性化の大きさと重みの分布の詳細な分析を実施し、最適化の選択と量子化耐性の関連を特定した。
Figure 1 : Mean zero-shot accuracy on HellaSwag, PIQA, LAMBADA, and WinoGrad. In contrast to the OPT family, our models show minimal degradation after simple vectorwise quantization. Data points for OPT models are from (Dettmers & Zettlemoyer, 2022 ) .
Figure 1 : Mean zero-shot accuracy on HellaSwag, PIQA, LAMBADA, and WinoGrad. In contrast to the OPT family, our models show minimal degradation after simple vectorwise quantization. Data points for OPT models are from (Dettmers & Zettlemoyer, 2022 ) .

実験結果

リサーチクエスチョン

  • RQ1大規模モデルにおける量子化下での性能低下は、スケールに起因する発生的性質なのか、それとも事前学習中の最適化選択によって緩和可能なのか?
  • RQ2重み減衰、勾配クリッピング、精度といった特定の学習ハイパーパラメータのうち、活性化の外れ値に最も顕著に影響を与えるのはどれか?
  • RQ352Bパラメータのモデルが、混合精度分解を用いずに、標準的な事後量子化(PTQ)でのみ、最小限の性能低下で量子化可能か?
  • RQ4事前学習段階で、活性化および重みの分布をどれほど制御可能か、低精度推論との適合性向上に寄与するか?
  • RQ5OPTやBLOOMのようなモデル間の量子化感受性の差は、アーキテクチャの違いに起因するのか、それとも最適化戦略の違いに起因するのか?

主な発見

  • 著者らは、410M~52Bパラメータのモデルを、単純な標準INT8事後量子化(PTQ)のみを用いて量子化に成功し、8つのゼロショットタスクで平均0.26%の性能低下にとどめた。
  • 52Bパラメータのモデルは、単純なINT8 PTQにおいても顕著な低下(平均0.26%の低下)を示さず、大規模モデルが複雑な混合精度技術を用いずに量子化可能であることを示した。
  • 活性化の外れ値は、従来はスケールに起因する発生的性質であると考えられていたが、重み減衰や勾配クリッピングといった最適化ハイパーパラメータに敏感であることが明らかになった。
  • 高い重み減衰と低い勾配クリッピングで学習されたモデルは、顕著に低い活性化外れ値の大きさを示し、量子化耐性が向上した。
  • 本研究では、OPTやBLOOMのようなモデル間の量子化感受性の差が、アーキテクチャやスケールそのものに起因するのではなく、事前学習の最適化戦略に起因することを特定した。
  • 制御されたアブレーションスタディにより、特定のハイパーパラメータの組み合わせが外れ値の次元を抑制し、特別な量子化手法を用いずに効果的な量子化を可能にすることが確認された。
(a)
(a)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。