Skip to main content
QUICK REVIEW

[论文解读] FracBits: Mixed Precision Quantization via Fractional Bit-Widths

Linjie Yang, Qing Jin|arXiv (Cornell University)|Jul 4, 2020
Advanced Neural Network Applications被引用 4
一句话总结

FracBits 提出了一种可微分的、一次性混合精度量化方法,将比特宽度视为整数比特宽度之间的连续分数值,从而实现对层级和核级精度的端到端优化。通过在相邻比特宽度之间插值量化权重,并使用可微分正则化项,该方法在 ImageNet 上实现了严格的模型尺寸和计算约束下的最先进精度表现。

ABSTRACT

Model quantization helps to reduce model size and latency of deep neural networks. Mixed precision quantization is favorable with customized hardwares supporting arithmetic operations at multiple bit-widths to achieve maximum efficiency. We propose a novel learning-based algorithm to derive mixed precision models end-to-end under target computation constraints and model sizes. During the optimization, the bit-width of each layer / kernel in the model is at a fractional status of two consecutive bit-widths which can be adjusted gradually. With a differentiable regularization term, the resource constraints can be met during the quantization-aware training which results in an optimized mixed precision model. Further, our method can be naturally combined with channel pruning for better computation cost allocation. Our final models achieve comparable or better performance than previous quantization methods with mixed precision on MobilenetV1/V2, ResNet18 under different resource constraints on ImageNet dataset.

研究动机与目标

  • 解决基于强化学习的混合精度量化方法效率低下且探索成本高的问题。
  • 实现对量化神经网络中层或核级比特宽度分配的端到端可微分优化。
  • 通过允许分数比特宽度,在严格资源约束(模型尺寸和计算成本)下提升模型精度。
  • 在统一的可微分框架中同时支持层级和核级混合精度量化。
  • 通过引入连续比特宽度参数的一次性训练,减少对昂贵搜索或多个模型变体训练的需求。

提出的方法

  • 将比特宽度建模为连续可学习参数,插值于两个相邻整数比特宽度之间(例如 3.2-bit),用于每个层或核。
  • 使用可微分插值函数,将量化激活和权重计算为两个相邻比特宽度下量化输出的加权平均。
  • 引入可微分正则化项,对资源使用量(模型尺寸或 FLOPs)进行惩罚,以在训练期间强制满足目标约束。
  • 通过连续比特宽度参数端到端训练整个网络,实现精度分配的基于梯度的优化。
  • 应用直通估计(Straight-Through Estimation, STE)以反向传播梯度通过量化操作,保持可微性。
  • 通过为每个卷积核或通道组分配独立的分数比特宽度,支持通道级和核级精度分配。

实验结果

研究问题

  • RQ1混合精度量化能否被表述为在连续比特宽度上的可微分优化问题?
  • RQ2一次性训练流程是否能在精度和效率上超越基于强化学习或迭代搜索的混合精度方法?
  • RQ3与均匀或离散混合精度相比,允许分数比特宽度是否能在严格模型尺寸和计算约束下提升模型精度?
  • RQ4在低比特量化中,核级精度分配是否能进一步提升性能,优于层级分配?
  • RQ5与 SAT 和 AutoQ 等强基线方法相比,所提方法在精度和资源效率方面表现如何?

主要发现

  • 在 2-bit MobileNet V1 上,FracBits-SAT 相较于统一量化基线 SAT 实现了 3.0% 的绝对 top-1 精度提升,在 2-bit MobileNet V2 上提升了 2.8%。
  • 在具有挑战性的 3-bit 设置下,FracBits-SAT 在 MobileNet V1 上比 SAT 提升 0.6% 的 top-1 精度,在 MobileNet V2 上提升了 0.8%。
  • 对于核级量化,FB-SAT-K 在 3-bit 和 4-bit 的 MobileNet V2 上分别相较 SAT 提升了 1.0% 和 0.8% 的 top-1 精度。
  • FB-SAT-K 相较于层级的 FracBits-SAT,在 3-bit 和 4-bit 的 MobileNet V2 上分别提升了 0.4% 和 0.3%,证明了核级精度分配的优势。
  • 在 ResNet18 上,FB-SAT-K 在 3-bit 和 4-bit 设置下相较 SAT 分别实现了 0.5% 的 top-1 精度提升,且在两种比特宽度下均保持一致的改进。
  • 该方法在模型尺寸和计算成本约束下实现了最先进性能,优于 HAQ、AutoQ 和 SAT 在所有评估设置下的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。