Skip to main content
QUICK REVIEW

[论文解读] Effective and Fast: A Novel Sequential Single Path Search for Mixed-Precision Quantization

Qigong Sun, Licheng Jiao|arXiv (Cornell University)|Mar 4, 2021
Advanced Image and Video Retrieval Techniques参考文献 60被引用 7
一句话总结

该论文提出了一种新颖的可微分顺序单路径搜索(SSPS)方法,用于混合精度量化,可在硬件约束下高效搜索网络各层的最优位宽分配。通过基于选择确定性的顺序确定精度,并采用单路径、梯度优化的搜索单元,SSPS显著降低了内存使用并加速了收敛,在ResNet-18上实现CIFAR-10、ImageNet和COCO数据集上的最先进精度,且搜索时间少于28 GPU小时。

ABSTRACT

Since model quantization helps to reduce the model size and computation latency, it has been successfully applied in many applications of mobile phones, embedded devices and smart chips. The mixed-precision quantization model can match different quantization bit-precisions according to the sensitivity of different layers to achieve great performance. However, it is a difficult problem to quickly determine the quantization bit-precision of each layer in deep neural networks according to some constraints (e.g., hardware resources, energy consumption, model size and computation latency). To address this issue, we propose a novel sequential single path search (SSPS) method for mixed-precision quantization,in which the given constraints are introduced into its loss function to guide searching process. A single path search cell is used to combine a fully differentiable supernet, which can be optimized by gradient-based algorithms. Moreover, we sequentially determine the candidate precisions according to the selection certainties to exponentially reduce the search space and speed up the convergence of searching process. Experiments show that our method can efficiently search the mixed-precision models for different architectures (e.g., ResNet-20, 18, 34, 50 and MobileNet-V2) and datasets (e.g., CIFAR-10, ImageNet and COCO) under given constraints, and our experimental results verify that SSPS significantly outperforms their uniform counterparts.

研究动机与目标

  • 为解决在模型大小、延迟和能耗等硬件约束下,高效确定深度神经网络中混合精度位宽分配的挑战。
  • 降低现有基于可微分神经架构搜索(NAS)的混合精度搜索方法的高内存与计算成本,这些方法需同时评估所有候选方案。
  • 通过基于选择确定性的顺序精度选择,指数级减少搜索空间,从而加速收敛并提升搜索稳定性。
  • 实现单一、约束引导的搜索,直接针对特定硬件约束(如平均权重/激活位宽)进行优化,无需多次迭代。
  • 支持逐层混合精度量化——不同于块级方法——实现每层更细粒度的精度自适应。

提出的方法

  • 提出一种新颖的可微分单路径搜索单元,每次前向传播仅评估一个候选精度,与超网络方法相比显著降低了内存使用。
  • 将硬件约束(如平均权重和激活位宽)直接嵌入损失函数,以引导搜索过程朝向可行且可部署的模型。
  • 采用带温度退火的Gumbel-Softmax,实现可微分架构搜索,支持对精度选择进行基于梯度的优化。
  • 采用顺序决策机制:按选择确定性顺序处理各层,仅固定最确定的选择,从而实现指数级减少搜索空间。
  • 利用完全可微分的超网络,其中每个搜索单元包含多个精度候选(如2位至6位),但每次前向传播仅激活一个。
  • 应用温度衰减调度以稳定训练并提升收敛性,最终模型在完整优化后获得。

实验结果

研究问题

  • RQ1与完整超网络方法相比,顺序单路径搜索策略是否能降低内存消耗并加速混合精度量化搜索的收敛?
  • RQ2将硬件约束直接嵌入损失函数,是否能实现一次完成的搜索,以获得满足特定目标约束(如平均位宽)的模型?
  • RQ3在相同约束下,逐层精度分配是否优于块级分配,从而在模型精度上表现更优?
  • RQ4基于选择确定性的顺序决策机制如何影响搜索稳定性与收敛速度?
  • RQ5所提方法是否能在多样化的数据集(CIFAR-10、ImageNet、COCO)上实现最先进性能,同时最小化搜索成本?

主要发现

  • 与基于DARTS的方法相比,SSPS显著降低了GPU内存使用,图1(a)显示其在搜索过程中内存消耗明显更低。
  • 该方法收敛速度快于DNAS,在ImageNet上完成ResNet-18的搜索耗时不足28 GPU小时,而DNAS需40 GPU小时。
  • 基于确定性的顺序决策机制与剪枝策略,使搜索空间呈指数级减少,提升了收敛稳定性,如图4所示。
  • 在CIFAR-10、ImageNet和COCO数据集上,SSPS在相同约束下实现了优于均匀量化和最先进基线方法的top-1精度。
  • 该方法支持逐层混合精度量化,允许每层采用不同精度——甚至在同一模块内——而不同于块级方法(如DNAS和BP-NAS)。
  • 消融研究证实,若移除决策操作(SPS变体),将导致收敛更慢且更不稳定,验证了顺序选择机制的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。