Skip to main content
QUICK REVIEW

[论文解读] OMPQ: Orthogonal Mixed Precision Quantization

Yuexiao Ma, Taisong Jin|arXiv (Cornell University)|Sep 16, 2021
Advanced Neural Network Applications参考文献 39被引用 8
一句话总结

OMPQ 提出了一种新颖的混合精度量化方法,通过学习到的正交性度量(ORM)利用线性规划高效确定神经网络各层的最优位宽,实现最低的搜索成本,达到最先进的精度——在仅 6.7 MB 且无需迭代搜索的情况下,ResNet-18 的 Top-1 准确率达到 72.08%。

ABSTRACT

To bridge the ever increasing gap between deep neural networks' complexity and hardware capability, network quantization has attracted more and more research attention. The latest trend of mixed precision quantization takes advantage of hardware's multiple bit-width arithmetic operations to unleash the full potential of network quantization. However, this also results in a difficult integer programming formulation, and forces most existing approaches to use an extremely time-consuming search process even with various relaxations. Instead of solving a problem of the original integer programming, we propose to optimize a proxy metric, the concept of network orthogonality, which is highly correlated with the loss of the integer programming but also easy to optimize with linear programming. This approach reduces the search time and required data amount by orders of magnitude, with little compromise on quantization accuracy. Specifically, we achieve 72.08% Top-1 accuracy on ResNet-18 with 6.7Mb, which does not require any searching iterations. Given the high efficiency and low data dependency of our algorithm, we used it for the post-training quantization, which achieve 71.27% Top-1 accuracy on MobileNetV2 with only 1.5Mb. Our code is available at https://github.com/MAC-AutoML/OMPQ.

研究动机与目标

  • 解决现有混合精度量化方法依赖迭代搜索或松弛技术所带来的高计算与数据成本问题。
  • 在不牺牲模型精度的前提下,降低混合精度量化中位宽配置的时间与数据需求。
  • 开发一种可高效计算且与模型性能高度相关的量化精度代理度量。
  • 通过最小化对大规模数据与微调的依赖,实现高效的后训练量化。
  • 建立一个可无缝集成至现有量化方案的框架,涵盖量化感知训练与后训练量化两种方式。

提出的方法

  • 通过将函数正交性推广至深度神经网络,提出一种新颖的正交性度量(ORM),利用蒙特卡洛采样与柯西-施瓦茨不等式衡量层间正交性。
  • 将位宽分配问题建模为线性规划优化问题,在压缩与硬件约束下最大化模型正交性。
  • 推导出 ORM 的等价、计算高效的表达形式,以加速正交性计算,实现单次遍历评估。
  • 利用 ORM 与量化精度及位宽之间的强正相关性,指导最优位宽分配。
  • 将 OMPQ 集成至量化感知训练与后训练量化(PTQ)流程中,替代代价高昂的搜索机制(如进化算法或强化学习)。
  • 使用单调递减函数(如 $ e^{-x} $)建模准确率与压缩率之间的权衡,确保优化过程稳定。

实验结果

研究问题

  • RQ1基于神经网络正交性的代理度量是否能有效替代混合精度量化中迭代或松弛基搜索?
  • RQ2所提出的正交性度量(ORM)与实际量化模型准确率及位宽分配的相关性如何?
  • RQ3与 HAWQ、FracBits 或 BRECQ 等现有方法相比,OMPQ 在位宽配置方面能多大程度上降低数据与计算需求?
  • RQ4OMPQ 是否能在极小数据量且无需微调的情况下,实现在后训练量化中的竞争力表现?
  • RQ5基于 ORM 的位宽分配线性规划公式是否能在多种架构上生成最优或近似最优的配置?

主要发现

  • OMPQ 在 ResNet-18 上实现 72.08% 的 Top-1 准确率,模型大小仅 6.7 MB,计算量为 75 BOPs,相比 HAWQ-V3 提升 1.86%,且无需迭代搜索。
  • 在 ResNet-50 上,OMPQ 实现 76.28% 的 Top-1 准确率,模型大小为 18.7 MB,计算量为 156 BOPs,相比 HAWQ-V3 提升 0.89%,且模型大小相近。
  • 在后训练量化中,OMPQ 在 MobileNetV2 上实现 71.27% 的 Top-1 准确率,模型大小仅 1.5 MB,相比 BRECQ 在相同模型大小约束下提升 0.52%。
  • OMPQ 将搜索成本降低数个数量级——仅需在小规模数据集上进行单次遍历评估,远低于基于进化或强化学习的方法。
  • ORM 度量与量化精度及位宽均呈现强正相关性,验证了其作为优化可靠代理度量的有效性。
  • OMPQ 的高效性使其适用于低数据场景,适合在数据访问受限的实际部署环境中使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。