[论文解读] Differentiable Dynamic Quantization with Mixed Precision and Adaptive Resolution
本文提出可微分动态量化(DDQ),一种完全可微分的框架,可联合学习神经网络中每层的最优量化参数——位宽、动态范围和步长。通过支持基于梯度的端到端训练,DDQ在低比特量化中实现了最先进性能,包括在ImageNet上对MobileNetV2实现无损4比特量化。
Model quantization is challenging due to many tedious hyper-parameters such as precision (bitwidth), dynamic range (minimum and maximum discrete values) and stepsize (interval between discrete values). Unlike prior arts that carefully tune these values, we present a fully differentiable approach to learn all of them, named Differentiable Dynamic Quantization (DDQ), which has several benefits. (1) DDQ is able to quantize challenging lightweight architectures like MobileNets, where different layers prefer different quantization parameters. (2) DDQ is hardware-friendly and can be easily implemented using low-precision matrix-vector multiplication, making it capable in many hardware such as ARM. (3) Extensive experiments show that DDQ outperforms prior arts on many networks and benchmarks, especially when models are already efficient and compact. e.g., DDQ is the first approach that achieves lossless 4-bit quantization for MobileNetV2 on ImageNet.
研究动机与目标
- 解决模型量化中高超参数敏感性的问题,特别是针对MobileNets等高效架构。
- 克服固定量化方案(如均匀或2的幂次)的局限性,这些方案无法捕捉轻量级模型中不规则的权重分布。
- 通过端到端的梯度优化,实现量化参数的联合学习,以最小化量化误差并保持模型精度。
- 使用低精度矩阵-向量运算实现硬件友好型量化,适用于ARM及其他边缘设备的部署。
- 减少低比特量化中的训练时间并提升精度,尤其在精度余量极小的紧凑模型中。
提出的方法
- 通过使用直通估计器对非可微的四舍五入操作进行可微分近似,将量化形式化为可微函数。
- 通过反向传播在训练过程中学习每层的量化参数,包括位宽、步长和动态范围。
- 引入梯度校正机制以稳定训练并降低量化误差,尤其在低比特场景下。
- 通过支持每层不同位宽的混合精度量化,在内存约束下实现最优配置。
- 通过学习非均匀量化级别实现自适应分辨率,更好地匹配不规则权重分布(如高斯分布、重尾分布、双峰分布)。
- 通过使用低精度矩阵-向量乘法实现硬件友好型量化,支持在移动DSP和ARM设备上的高效部署。
实验结果
研究问题
- RQ1是否能够通过完全可微分的量化框架,联合优化每层的位宽、步长和动态范围,以最小化量化误差?
- RQ2在不规则权重分布上,使用非均匀量化级别的自适应分辨率是否能提升精度,优于均匀或2的幂次量化器?
- RQ3梯度校正是否能稳定低比特场景下的训练并降低量化误差,特别是在2比特和4比特量化中?
- RQ4DDQ是否能在ImageNet上实现MobileNetV2的无损4比特量化,优于先前最先进方法?
- RQ5与固定精度基线相比,通过每层位宽选择实现的混合精度量化是否能提升精度和效率?
主要发现
- DDQ在ImageNet上实现了MobileNetV2的无损4比特量化,与全精度模型相比精度下降仅为0.4%。
- 与最先进量化方法相比,DDQ将训练运行时间减少了25%,同时保持或提升了精度。
- 在梯度校正下,DDQ的量化误差更低(平均误差0.35),且对原始权重分布的拟合优于PACT+UQ或PACT+PoT。
- DDQ成功实现了2比特MobileNetV2的量化,且无需全精度激活,这是先前方法未能实现的能力。
- 在移动DSP上,DDQ实现了71.9%的top-1准确率,延迟比全精度模型降低40%,且比UQ基线高出3%。
- 采用每层学习位宽的混合精度DDQ在ImageNet上实现了71.9%的top-1准确率,优于固定精度基线,并实现了更优的内存-精度权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。