[论文解读] Understanding INT4 Quantization for Transformer Models: Latency Speedup, Composability, and Failure Cases
本文研究了用于Transformer语言模型的INT4量化(W4A4),在仅编码器(BERT)和编码器-解码器(BART)模型中实现了近乎零的精度损失,但在仅解码器(GPT)模型中出现了显著性能下降。本文提出了一条高度优化的端到端INT4推理流水线,与FP16相比实现了最高8.5倍的延迟加速,与SOTA INT8推理相比提升了1.7倍,同时分析了失败案例,并研究了与剪枝和层减少的可组合性。
Improving the deployment efficiency of transformer-based language models has been challenging given their high computation and memory cost. While INT8 quantization has recently been shown to be effective in reducing both the memory cost and latency while preserving model accuracy, it remains unclear whether we can leverage INT4 (which doubles peak hardware throughput) to achieve further latency improvement. In this study, we explore the feasibility of employing INT4 weight and activation (W4A4) quantization for language models. Our findings indicate that W4A4 quantization introduces no to negligible accuracy degradation for encoder-only and encoder-decoder models, but causes a significant accuracy drop for decoder-only models. To materialize the performance gain using W4A4, we develop a highly optimized end-to-end W4A4 encoder inference pipeline supporting different quantization strategies. Our INT4 pipeline is $8.5 imes$ faster for latency-oriented scenarios and up to $3 imes$ for throughput-oriented scenarios compared to the inference of FP16, and improves the SOTA BERT INT8 performance from FasterTransformer by up to $1.7 imes$. We provide insights into the failure cases when applying W4A4 to decoder-only models, and further explore the compatibility of INT4 quantization with other compression methods, like pruning and layer reduction.
研究动机与目标
- 评估W4A4量化(4-bit权重和激活)在基于Transformer的语言模型中的可行性,尤其关注精度下降问题。
- 为编码器模型开发高性能、高度优化的端到端INT4推理流水线,支持低延迟和高吞吐量工作负载。
- 分析在W4A4量化下,仅解码器模型(如GPT)出现精度下降的根本原因。
- 研究INT4量化与其他压缩技术(如剪枝和层减少)的可组合性。
- 通过利用现代GPU上INT4计算的更高吞吐量,超越现有SOTA INT8推理性能。
提出的方法
- 采用逐层知识蒸馏结合量化感知训练(QAT),以实现BERT和BART模型的W4A4量化。
- 采用后训练量化技术,结合动态范围校准和裁剪,以最小化权重和激活量化过程中的精度损失。
- 设计模块化、高度优化的INT4推理流水线,使用CUDA内核和Tensor Cores,支持多种量化策略以实现延迟或吞吐量优化。
- 对所有线性层(包括注意力和前馈网络)应用量化,同时对残差连接保持完整的FP16精度以维持稳定性。
- 通过消融实验研究层归一化、预训练影响和注意力机制,以隔离仅解码器模型中的失败模式。
- 通过组合W4A4与50%权重稀疏性(Ampere架构)及25%层减少,评估可组合性,并测量精度与性能之间的权衡。

实验结果
研究问题
- RQ1W4A4量化能否在仅编码器(BERT)、编码器-解码器(BART)和仅解码器(GPT)的Transformer模型中应用,且精度损失可接受?
- RQ2在W4A4量化下,仅解码器模型中出现显著精度下降的主要原因是什么?
- RQ3如何设计一个高度优化的端到端INT4推理流水线,以在现代GPU硬件上最大化延迟和吞吐量的提升?
- RQ4INT4量化在多大程度上可以与其他压缩技术(如剪枝和层减少)组合使用,而不会导致显著的性能下降?
- RQ5所提出的INT4流水线能否在推理性能上超越现有SOTA INT8实现?
主要发现
- W4A4量化在分类和摘要任务中,对仅编码器(BERT)和编码器-解码器(BART)模型造成的精度损失可忽略不计。
- 仅解码器模型(如GPT)在W4A4量化下出现显著的精度下降,尤其在自回归生成任务中。
- 所提出的INT4推理流水线在延迟优化场景下相比HuggingFace FP16推理最高实现8.5倍加速,在吞吐量优化场景下最高实现3倍加速。
- 该流水线将FasterTransformer的SOTA BERT INT8性能提升了最高1.7倍,证明了INT4相比INT8的性能优势。
- 层减少实验表明,9层的W4A4 BART模型(6-编码器,3-解码器)在CNNDailyMail数据集上保持了原始12层模型99.4%的性能。
- 可组合性实验表明,将W4A4与50%稀疏性结合仅导致约0.5 GLUE点的精度下降,而与25%层减少结合时,摘要任务的精度基本保持稳定。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。