[论文解读] AdaBits: Neural Network Quantization with Adaptive Bit-Widths
AdaBits 提出一种联合训练方法,实现权重和激活值的自适应位宽量化,使模型能即时适应不同的硬件约束。通过引入可切换裁剪级别(S-CL),将不同位宽的裁剪参数解耦,该方法在 ImageNet 上的 MobileNet V1/V2 和 ResNet50 模型上实现了与独立量化模型相当的精度,即使在 2 位和 3 位等低比特位宽下性能下降也极小。
Deep neural networks with adaptive configurations have gained increasing attention due to the instant and flexible deployment of these models on platforms with different resource budgets. In this paper, we investigate a novel option to achieve this goal by enabling adaptive bit-widths of weights and activations in the model. We first examine the benefits and challenges of training quantized model with adaptive bit-widths, and then experiment with several approaches including direct adaptation, progressive training and joint training. We discover that joint training is able to produce comparable performance on the adaptive model as individual models. We further propose a new technique named Switchable Clipping Level (S-CL) to further improve quantized models at the lowest bit-width. With our proposed techniques applied on a bunch of models including MobileNet-V1/V2 and ResNet-50, we demonstrate that bit-width of weights and activations is a new option for adaptively executable deep neural networks, offering a distinct opportunity for improved accuracy-efficiency trade-off as well as instant adaptation according to the platform constraints in real-world applications.
研究动机与目标
- 通过在推理过程中动态调整权重和激活值的位宽,实现实时、硬件自适应的深度神经网络部署。
- 解决在不重新训练的情况下,将模型量化到不同位宽时保持高精度的挑战,尤其是在低比特位宽下。
- 探究是否可通过在多个位宽间共享参数的联合训练,使模型性能达到与独立训练的量化模型相当。
- 开发一种机制,防止训练过程中不同位宽配置之间的干扰,特别是裁剪级别优化中的干扰。
- 证明位宽是模型压缩和自适应部署中一个可行且有效的自由度,超越宽度、深度和卷积核大小。
提出的方法
- 提出一种联合训练框架,单个模型可同时支持多个位宽,共享所有参数,仅位宽特定的裁剪级别除外。
- 引入可切换裁剪级别(S-CL)机制,为每个位宽分配独立的裁剪级别参数,防止跨位宽优化干扰。
- 采用比例调整训练(SAT)方法作为基线量化方案,并将其整合到联合训练过程中,实现一致的量化感知训练。
- 采用可微分路由机制,在训练期间切换不同位宽,实现所有位宽配置的端到端优化。
- 使用一种改进方案,仅存储全精度权重,并在运行时按位宽即时量化,相比为每个位宽存储量化权重,显著减小模型尺寸。
- 采用渐进式训练策略作为基线进行对比,评估按升序或降序位宽顺序训练时的性能退化情况。
实验结果
研究问题
- RQ1能否通过联合训练使单个神经网络同时支持多个权重和激活值的位宽,且在所有配置下均保持高精度?
- RQ2在从高到低位宽的渐进式训练中,是否存在性能退化?
- RQ3在 2 位和 3 位等低比特位宽下,使用位宽特定裁剪级别的共享模型是否能超越独立训练的模型?
- RQ4可切换裁剪级别(S-CL)机制如何通过为每个位宽解耦裁剪参数来提升量化性能?
- RQ5与传统的宽度乘数缩放等模型压缩技术相比,自适应位宽在多大程度上能改善精度-效率权衡?
主要发现
- 采用 S-CL 的联合训练在 ImageNet 上实现的测试精度,与 MobileNet V1、MobileNet V2 和 ResNet50 在所有位宽下独立量化模型的精度几乎完全一致。
- 在 2 位 ResNet50 上,采用 S-CL 的 AdaBits 达到 34.1% 的 top-1 精度,显著优于按降序位宽进行渐进训练的方案(仅 28.5%)。
- 在 4 位和 3 位 ResNet50 上,AdaBits 相比按降序位宽的渐进量化方案,精度提升 2.2%,展现出强大的泛化能力。
- 采用 S-CL 的改进型 AdaBits 方案在 4 位 MobileNet V1 上相比原始 AdaBits 提升 0.3% 精度,表明更优的裁剪级别管理可带来增量收益。
- 在 6 位时,AdaBits 的性能与全精度模型相当,模型尺寸缩小 4.74 倍,BitOPs 减少 14.25 倍,优于宽度乘数缩放(0.35×)仅实现 2.06 倍的尺寸缩减。
- S-CL 机制可为每个位宽实现最优裁剪级别,如 AB-MobileNet V1 的可视化所示,更高位宽始终使用更大的裁剪级别,与独立模型行为一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。