Skip to main content
QUICK REVIEW

[论文解读] Integer or Floating Point? New Outlooks for Low-Bit Quantization on Large Language Models

Yijia Zhang, Lingran Zhao|arXiv (Cornell University)|May 21, 2023
Topic Modeling被引用 5
一句话总结

该论文提出了一种逐层的混合格式量化方法(Mixture of Formats Quantization, MoFQ),通过在相同位宽下动态选择 INT 或 FP 格式(例如 INT8/FP8)来优化大语言模型的低比特量化。MoFQ 在仅权重量化和权重量激活量化中均实现了当前最优性能,在 4 位权重量化中超越 GPTQ,速度提升 10 倍,且在 8 位权重量激活量化中达到与全精度模型相当的准确率,同时无需硬件开销。

ABSTRACT

Efficient deployment of large language models (LLMs) necessitates low-bit quantization to minimize model size and inference cost. While low-bit integer formats (e.g., INT8/INT4) have been the conventional choice, emerging low-bit floating-point formats (e.g., FP8/FP4) offer a compelling alternative and are gaining support from cutting-edge hardware, such as NVIDIA's H100 GPU. However, the superiority of low-bit INT versus FP formats for quantization on LLMs remains unclear. In this study, we conduct a comparative analysis of INT and FP quantization with the same bit-width, revealing that the optimal quantization format varies across different layers due to the complexity and diversity of tensor distribution. Consequently, we advocate the Mixture of Formats Quantization (MoFQ), which selects the optimal format on a layer-wise basis. This simple yet effective approach achieves state-of-the-art results in both weight-only (W-only) and weight-activation (WA) post-training quantization scenarios when tested on LLaMA across various tasks. In 4-bit W-only quantization, MoFQ surpasses GPTQ without complex hyperparameter tuning and with an order of magnitude faster quantization speed. While in 8-bit WA quantization, MoFQ significantly outperforms INT/FP-only methods, achieving performance close to the full precision model. Notably, MoFQ incurs no hardware overhead compared to INT/FP-only quantization, as the bit-width remains unchanged.

研究动机与目标

  • 探究在大语言模型的低比特量化中,INT 格式与 FP 格式哪一个更优。
  • 解决由于张量分布差异导致 INT 或 FP 格式在不同层间缺乏一致优势的问题。
  • 开发一种实用且硬件兼容的方法,按层选择最优格式以最小化量化误差。
  • 在不增加比特宽度或硬件成本的前提下,实现在仅权重量化和权重量激活量化中的 SOTA 性能。

提出的方法

  • 该方法通过张量 MSE、层输出 MSE 或模型输出 MSE 等指标评估量化误差,以选择每层的最优格式。
  • MoFQ 在逐层基础上在相同位宽的 INT 和 FP 格式之间进行选择(例如 INT8 与 FP8),确保每层的数据类型和位宽一致。
  • 格式选择基于经验误差最小化,无需复杂超参数调优或二阶优化。
  • MoFQ 与现有 INT 仅量化硬件兼容,并可无缝集成至如 NVIDIA H100 等新兴 FP8 支持硬件。
  • 该方法保持每层相同的位宽和数据类型,避免额外的硬件或内存开销。
  • 支持仅权重量化(用于模型压缩)和权重量激活量化(用于推理加速)。

实验结果

研究问题

  • RQ1在相同位宽下(如 8 位),INT 或 FP 量化是否在大语言模型的所有层中均持续优于另一种?
  • RQ2张量分布特性(如动态范围与静态范围、异常值存在性、数值范围)如何影响 INT 与 FP 量化性能的相对表现?
  • RQ3一种按层选择最优格式的混合格式策略,是否能优于统一使用 INT 或 FP 的量化方法?
  • RQ4在低比特宽度(如 8 位和 4 位)下,INT 与 FP 乘加单元之间的硬件效率权衡如何?
  • RQ5在 4 位仅权重量化中,一种简单且低开销的格式选择策略,是否能超越 GPTQ 等复杂且依赖超参数调优的方法?

主要发现

  • 在 4 位仅权重量化中,MoFQ 的性能与 GPTQ 相当或更优,且量化速度提升一个数量级。
  • 在 8 位权重量激活量化中,MoFQ 显著优于纯 INT8 和 FP8 方法,实现接近全精度 FP16 基线的模型准确率。
  • MoFQ 在多个基准测试(WikiText-2、LAMBADA、PIQA、HellaSwag)上,针对不同尺寸的 LLaMA 和 OPT 模型均实现了 SOTA 结果。
  • 在 WikiText-2 上,MoFQ8 在 LLaMA-13B 上实现困惑度 5.41,优于 FP8(5.41)和 INT8(637.95),其中 92.7% 的层选择了 FP8 格式。
  • 该方法在各类模型上均保持极低的精度损失:对于 LLaMA-33B,MoFQ8 在 LAMBADA 上实现 0.859 的平均准确率,与 FP16 的 0.862 接近,其中 90.0% 的层使用了 FP8。
  • 与仅 INT 量化相比,MoFQ 不增加任何硬件开销,因为每层的位宽和数据类型保持不变。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。