Skip to main content
QUICK REVIEW

[论文解读] FPTQ: Fine-grained Post-Training Quantization for Large Language Models

Qingyuan Li, Yifan Zhang|arXiv (Cornell University)|Aug 30, 2023
Topic ModelingComputer Science被引用 3
一句话总结

该论文提出FPTQ,一种新颖的大型语言模型细粒度过训量化方法,在无需微调的情况下实现了SOTA(最先进)的W4A8(4-bit权重,8-bit激活)性能。通过结合逐层激活量化与一种针对困难层的新型对数均衡技术,以及细粒度过滤权重量化,FPTQ实现了INT8推理与INT4权重存储,显著提升了内存与计算效率,同时在BLOOM、LLaMA和LLaMA-2基准测试中保持了模型精度。

ABSTRACT

In the era of large-scale language models, the substantial parameter size poses significant challenges for deployment. Being a prevalent compression technique, quantization has emerged as the mainstream practice to tackle this issue, which is mainly centered on two recipes W8A8 and W4A16 (i.e. weights and activations in such bit widths). In this study, we propose a novel W4A8 post-training quantization method for the available open-sourced LLMs, which combines the advantages of both two recipes. Therefore, we can leverage the benefit in the I/O utilization of 4-bit weight quantization and the acceleration due to 8-bit matrix computation. Nevertheless, the W4A8 faces notorious performance degradation. As a remedy, we involve layerwise activation quantization strategies which feature a novel logarithmic equalization for most intractable layers, and we combine them with fine-grained weight quantization. Without whistles and bells, we eliminate the necessity for further fine-tuning and obtain the state-of-the-art W4A8 quantized performance on BLOOM, LLaMA, and LLaMA-2 on standard benchmarks. We confirm that the W4A8 quantization is achievable for the deployment of large language models, fostering their wide-spreading real-world applications.

研究动机与目标

  • 解决大型语言模型在W4A8过训量化中常见的性能下降问题。
  • 通过优化内存访问与计算吞吐量,实现资源受限设备上大型语言模型的高效部署。
  • 在不依赖微调的情况下,保持W4A8量化中的最先进精度。
  • 开发一种可泛化、面向推理的量化方案,实现4-bit权重存储与8-bit激活计算的和谐统一。

提出的方法

  • 提出一种逐层量化策略,根据模型不同层间激活分布的难易程度自适应调整。
  • 引入一种新型对数激活均衡(LAE)技术,以稳定困难层中的极端激活异常值,使其更利于量化。
  • 对4-bit权重应用细粒度过滤量化,同时保持8-bit激活,以在现代硬件上实现高效的矩阵乘法。
  • 利用离线激活统计信息计算缩放因子,无需模型微调或梯度更新。
  • 采用超参数化抑制函数,控制激活抑制水平,提升在多样化层上的鲁棒性。
  • 设计一种策略,通过逐层解耦权重与激活量化决策,避免混合量化方案中常见的性能下降问题。

实验结果

研究问题

  • RQ1W4A8过训量化能否在无需微调的情况下于大型语言模型上实现最先进性能?
  • RQ2在低比特设置下,如何稳定具有极端范围的激活分布,以减少量化误差?
  • RQ3结合对数均衡的逐层量化策略是否能在W4A8设置下优于均匀或全局量化?
  • RQ4在实际应用中,4-bit权重与8-bit激活的组合是否比W8A8或W4A16具有更好的推理效率?
  • RQ5所提方法能否在无需模型特定适配的情况下,于BLOOM、LLaMA和LLaMA-2等多样化大型语言模型上保持高精度?

主要发现

  • FPTQ在BLOOM-7B1、LLaMA-7B和LLaMA-2-7B上,于MMLU和Common Sense QA等标准基准测试中,无需任何微调即实现了SOTA的W4A8性能。
  • 在LLaMA-7B上,FPTQ保持了平均MMLU得分为73.42,仅比FP16基线低1.09分,尽管使用了4-bit权重。
  • 在LLaMA-2-7B上,FPTQ实现了平均MMLU得分为73.77,优于W4A8基线,且与FP16模型仅相差0.91分。
  • 消融研究显示,在LAE之后应用GPTQ微调会降低性能,证实FPTQ的成功源于其无需额外调优的过训设计。
  • 该方法实现了高效的INT8推理与INT4权重存储,减轻了自解码阶段的内存带宽压力,同时加速了上下文解码阶段的计算。
  • 对数均衡技术有效稳定了异常值易发层的激活分布,如图1所示,量化稳定性得到显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。