[论文解读] Finding the Task-Optimal Low-Bit Sub-Distribution in Deep Neural Networks
该论文提出DGMS,一种可微分高斯混合权重共享方法,通过端到端联合微调权重与基于具体高斯混合近似的子分布,自动学习深度神经网络中的任务最优低比特子分布。与依赖ELBO或手动配置的方法不同,DGMS直接优化任务目标,实现了SOTA量化性能,在移动CPU上实现高达7.46倍的推理加速,并展现出强大的零样本迁移能力。
Quantized neural networks typically require smaller memory footprints and lower computation complexity, which is crucial for efficient deployment. However, quantization inevitably leads to a distribution divergence from the original network, which generally degrades the performance. To tackle this issue, massive efforts have been made, but most existing approaches lack statistical considerations and depend on several manual configurations. In this paper, we present an adaptive-mapping quantization method to learn an optimal latent sub-distribution that is inherent within models and smoothly approximated with a concrete Gaussian Mixture (GM). In particular, the network weights are projected in compliance with the GM-approximated sub-distribution. This sub-distribution evolves along with the weight update in a co-tuning schema guided by the direct task-objective optimization. Sufficient experiments on image classification and object detection over various modern architectures demonstrate the effectiveness, generalization property, and transferability of the proposed method. Besides, an efficient deployment flow for the mobile CPU is developed, achieving up to 7.46$ imes$ inference acceleration on an octa-core ARM CPU. Our codes have been publicly released at \url{https://github.com/RunpeiDong/DGMS}.
研究动机与目标
- 解决低比特权重量化中因分布差异导致的性能下降问题。
- 通过自动学习最优子分布,消除量化过程中手动超参数调优的需要。
- 提升量化模型在不同视觉领域中的泛化能力和迁移能力。
- 通过简化推理流程,实现在移动CPU上的高效部署。
- 通过学习模型内在子分布而非依赖固定先验或ELBO目标,将量化重新定义为任务优化问题。
提出的方法
- 引入可微分高斯混合(GM)近似来建模潜在的低比特子分布,替代固定的狄拉克δ后验。
- 通过直接最小化任务损失,端到端联合微调网络权重与GM参数,避免ELBO优化的需要。
- 采用基于温度的softmax重参数化方法,弥合量化过程中训练与推理之间的差距。
- 在训练过程中将权重投影到GM近似的子分布上,实现平滑、可微分的量化。
- 采用自适应、自动化的机制,使GM随权重更新而演化,消除手动配置。
- 通过保持并行性并优化缓存访问,在移动CPU上高效部署量化模型。
实验结果
研究问题
- RQ1能否在无需手动超参数调优的情况下,自动发现模型内在的、任务最优的低比特子分布?
- RQ2与基于ELBO的变分推理相比,直接优化任务目标是否能带来更好的量化性能?
- RQ3所学习的子分布是否能在不同视觉领域中泛化,包括零样本迁移?
- RQ4DGMS在图像分类和目标检测任务中,能否实现高精度压缩且精度损失最小?
- RQ5DGMS在移动CPU上能实现多大程度的推理加速,同时不牺牲模型精度?
主要发现
- 与全精度模型相比,DGMS在八核ARM CPU上实现高达7.46倍的推理加速,精度损失可忽略。
- 在CIFAR-10上,4比特DGMS使用ResNet-20达到70.25%的top-1准确率,部分情况下优于全精度基线。
- 在零样本迁移设置下,DGMS在CUB-200-2011上达到77.46%的top-1准确率,在Stanford Cars上达到81.46%,与全精度模型相当。
- 在ImageNet上仅进行一个微调周期后,DGMS达到82.28%的top-1准确率,与全精度性能匹配。
- 所学习的子分布表现出强域不变性,支持在多样化数据集间实现有效的零样本量化。
- 尽管未作为训练目标,量化误差(以MSE衡量)在训练过程中自发减小,且与精度提升呈正相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。