[论文解读] Intriguing Properties of Quantization at Scale
本文表明,大语言模型中由量化引起的性能下降并非规模带来的必然涌现特性,而是预训练过程中特定优化选择的结果。通过仔细调整权重衰减、梯度裁剪和精度等超参数,作者训练了参数量从410M到52B不等的模型,在简单的INT8后训练量化下实现了近乎零性能下降(平均下降0.26%),证明了可以通过优化系统性地设计出对量化友好的模型。
Emergent properties have been widely adopted as a term to describe behavior not present in smaller models but observed in larger models. Recent work suggests that the trade-off incurred by quantization is also an emergent property, with sharp drops in performance in models over 6B parameters. In this work, we ask "are quantization cliffs in performance solely a factor of scale?" Against a backdrop of increased research focus on why certain emergent properties surface at scale, this work provides a useful counter-example. We posit that it is possible to optimize for a quantization friendly training recipe that suppresses large activation magnitude outliers. Here, we find that outlier dimensions are not an inherent product of scale, but rather sensitive to the optimization conditions present during pre-training. This both opens up directions for more efficient quantization, and poses the question of whether other emergent properties are inherent or can be altered and conditioned by optimization and architecture design choices. We successfully quantize models ranging in size from 410M to 52B with minimal degradation in performance.
研究动机与目标
- 探究大语言模型在量化下的性能悬崖是否为模型规模的固有特性,或是否受预训练期间优化选择的影响。
- 确定是否可以训练出在无需混合精度或微调的情况下,对简单后训练量化(PTQ)具有内在适应性的大模型。
- 识别出能够抑制激活值异常值并提升量化鲁棒性的特定预训练超参数。
- 证明可通过随机初始化,在从410M到52B参数的广泛模型尺寸范围内,系统性地训练出对量化友好的模型。
提出的方法
- 开展了一项受控的大规模研究,对相同架构的模型使用不同的优化超参数(包括权重衰减、梯度裁剪、dropout和混合精度训练)进行训练。
- 作者在保持架构和数据不变的前提下,系统性地改变关键训练超参数(如权重衰减、梯度裁剪和精度),在410M至52B参数的模型中进行实验。
- 采用标准INT8量化对权重和激活值进行后训练量化(PTQ),未在下游数据上进行微调或校准。
- 分析了不同模型中激活值和权重的分布,以识别异常值维度,并将其与优化选择相关联。
- 在8个零样本NLP基准测试(如HellaSwag、PIQA、LAMBADA、WinoGrad等)上评估性能,以衡量量化影响。
- 对激活值大小和权重分布进行了细粒度分析,以建立优化选择与量化鲁棒性之间的关联。

实验结果
研究问题
- RQ1在量化下观察到的大模型性能下降是否为规模的涌现特性,还是可通过预训练期间的优化选择加以缓解?
- RQ2哪些特定训练超参数(如权重衰减、梯度裁剪或精度)对激活值异常值的出现具有最显著影响?
- RQ3是否可以仅使用标准后训练量化(PTQ)对高达520亿参数的模型实现极低性能损失的量化,而无需混合精度分解?
- RQ4在预训练过程中,激活值和权重分布能在多大程度上被塑造,以提升与低精度推理的兼容性?
- RQ5OPT和BLOOM等模型之间量化敏感性的差异是由于架构差异还是优化策略所致?
主要发现
- 作者仅使用标准INT8后训练量化,成功对参数量从410M到52B的模型进行了量化,在8个零样本任务上的平均性能下降仅为0.26%。
- 520亿参数的模型在简单INT8 PTQ下表现出可忽略的性能下降——平均下降0.26%,证明大规模模型可在无需复杂混合精度技术的情况下实现有效量化。
- 此前被认为为规模涌现特性的激活值异常值,实际上对优化超参数(如权重衰减和梯度裁剪)极为敏感。
- 采用更高权重衰减和更低梯度裁剪训练的模型,其激活值异常值幅度显著降低,从而提升了量化鲁棒性。
- 研究发现,OPT与BLOOM等模型间量化敏感性的差异并非源于架构或规模本身,而是预训练优化选择所致。
- 受控的消融研究证实,特定超参数组合可有效抑制异常值维度,从而在无需专用量化方法的情况下实现高效量化。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。