[论文解读] HAWQV3: Dyadic Neural Network Quantization
HAWQ-V3 引入了一种混合精度整数仅量化框架,所有推理运算均仅使用整数乘法、加法和位移操作完成——完全消除浮点运算和整数除法。它采用硬件感知整数线性规划来优化比特精度设置,在 4 位量化下实现 1.45 倍加速,相比 INT8 实现 23% 延迟降低,同时保持高精度,所有结果均通过在真实硬件上使用 TVM 部署验证。
Current low-precision quantization algorithms often have the hidden cost of conversion back and forth from floating point to quantized integer values. This hidden cost limits the latency improvement realized by quantizing Neural Networks. To address this, we present HAWQV3, a novel mixed-precision integer-only quantization framework. The contributions of HAWQV3 are the following: (i) An integer-only inference where the entire computational graph is performed only with integer multiplication, addition, and bit shifting, without any floating point operations or even integer division; (ii) A novel hardware-aware mixed-precision quantization method where the bit-precision is calculated by solving an integer linear programming problem that balances the trade-off between model perturbation and other constraints, e.g., memory footprint and latency; (iii) Direct hardware deployment and open source contribution for 4-bit uniform/mixed-precision quantization in TVM, achieving an average speed up of $1.45 imes$ for uniform 4-bit, as compared to uniform 8-bit for ResNet50 on T4 GPUs; and (iv) extensive evaluation of the proposed methods on ResNet18/50 and InceptionV3, for various model compression levels with/without mixed precision. For ResNet50, our INT8 quantization achieves an accuracy of $77.58\%$, which is $2.68\%$ higher than prior integer-only work, and our mixed-precision INT4/8 quantization can reduce INT8 latency by $23\%$ and still achieve $76.73\%$ accuracy. Our framework and the TVM implementation have been open sourced.
研究动机与目标
- 消除神经网络推理中的浮点运算,实现与仅支持整数运算的硬件加速器完全兼容。
- 解决现有量化方法中浮点转换带来的隐性开销,该开销限制了延迟优化的潜力。
- 开发一种硬件感知的混合精度量化策略,以最优方式平衡精度、模型大小、延迟和计算成本。
- 通过 Apache TVM 实现 4 位和混合精度 INT4/INT8 模型在硬件上的直接部署,并验证性能。
- 通过新颖的整数算术和优化方法,实现比以往整数仅量化方法更高的精度和更快的推理速度。
提出的方法
- 该框架将所有推理运算——卷积、批量归一化和残差连接——仅使用整数算术(乘法、加法和位移)完成,完全不使用浮点运算或整数除法。
- 提出一种新颖的二元算术公式,将批量归一化参数合并到权重缩放和偏置中,实现 BN 层的完全整数仅计算。
- 采用硬件感知的混合精度量化策略,使用整数线性规划(ILP)公式联合优化每层的比特精度,在模型大小、延迟和 BOPS 约束下最小化模型扰动。
- ILP 求解器通过直接硬件测量结果引导,以找到在真实部署中平衡精度与性能的最优精度分配。
- 该框架与 Apache TVM 集成,支持 4 位和混合精度 INT4/INT8 推理,通过 PyTorch 中逐层激活匹配实现完整模型验证。
- 整个流水线已开源,包括框架、TVM 扩展和量化模型,所有结果均在 T4 GPU 上通过硬件验证。
实验结果
研究问题
- RQ1是否可以仅使用整数算术完成所有神经网络推理运算,而完全不使用浮点运算或整数除法?
- RQ2如何优化混合精度量化以最小化精度损失,同时满足特定应用对模型大小、延迟和计算成本的约束?
- RQ34 位量化是否能在不造成显著精度下降的前提下,实现相对于 8 位推理的显著加速?
- RQ4与启发式或模拟方法相比,通过 ILP 实现的硬件感知精度分配在真实性能和精度方面表现如何?
- RQ5整数仅量化是否能成功部署在真实硬件上,并实现经验证的精度和延迟改进?
主要发现
- HAWQ-V3 在 ImageNet 上使用 INT8 量化对 ResNet50 实现 77.58% 的 top-1 准确率,比以往整数仅方法高出 2.68%。
- 混合精度 INT4/8 量化使 ResNet50 的 INT8 推理延迟降低 23%,同时保持 76.73% 的准确率。
- 在 T4 GPU 上,HAWQ-V3 相比 8 位推理,使用 4 位统一量化实现 1.45 倍加速。
- 对于 ResNet18,基于 ILP 的混合精度设置在 6% 更快的速度下实现 71.09% 的准确率,模型大小为 7.2MB。
- ILP 求解器在所有模型上均于 1 秒内找到最优精度分配,支持实际部署。
- 所有结果均通过 TVM 在真实硬件上验证,逐层激活匹配精度达到机器精度,确认无仿真偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。