Skip to main content
QUICK REVIEW

[论文解读] FAT: Learning Low-Bitwidth Parametric Representation via Frequency-Aware Transformation

Chaofan Tao, Rui Lin|arXiv (Cornell University)|Feb 15, 2021
Anomaly Detection Techniques and Applications参考文献 32被引用 4
一句话总结

该论文提出频率感知变换(FAT),一种新颖的量化框架,通过在量化前学习网络权重的频域变换,提升低比特卷积神经网络(CNN)训练性能。通过抑制冗余的高频分量并保留具有信息量的低频内容,FAT使简单的均匀量化器实现最先进精度——4-bit ResNet-18在ImageNet上达到70.5% top-1准确率,4-bit MobileNet-V2达到69.2%,同时相比全精度模型将计算量减少高达54.9倍。

ABSTRACT

Learning convolutional neural networks (CNNs) with low bitwidth is challenging because performance may drop significantly after quantization. Prior arts often discretize the network weights by carefully tuning hyper-parameters of quantization (e.g. non-uniform stepsize and layer-wise bitwidths), which are complicated and sub-optimal because the full-precision and low-precision models have a large discrepancy. This work presents a novel quantization pipeline, Frequency-Aware Transformation (FAT), which has several appealing benefits. (1) Rather than designing complicated quantizers like existing works, FAT learns to transform network weights in the frequency domain before quantization, making them more amenable to training in low bitwidth. (2) With FAT, CNNs can be easily trained in low precision using simple standard quantizers without tedious hyper-parameter tuning. Theoretical analysis shows that FAT improves both uniform and non-uniform quantizers. (3) FAT can be easily plugged into many CNN architectures. When training ResNet-18 and MobileNet-V2 in 4 bits, FAT plus a simple rounding operation already achieves 70.5% and 69.2% top-1 accuracy on ImageNet without bells and whistles, outperforming recent state-of-the-art by reducing 54.9X and 45.7X computations against full-precision models. We hope FAT provides a novel perspective for model quantization. Code is available at \url{https://github.com/ChaofanTao/FAT_Quantization}.

研究动机与目标

  • 解决因全精度与低精度模型之间容量差距过大而导致的低比特CNN量化性能下降问题。
  • 克服复杂量化器因需大量超参数调优且在离散权重空间中易出现梯度消失而带来的局限性。
  • 通过学习的表示变换,使标准量化器能有效工作,从而减少对专用硬件或复杂量化方案的依赖。
  • 通过权重的全局频域分析利用神经元间相关性,提升低比特设置下的训练稳定性和性能。

提出的方法

  • 提出两阶段量化流程:首先对全精度权重应用可学习的频域变换T(·),然后应用标准量化器Q(·)。
  • 使用离散傅里叶变换(DFT)将空间域权重映射到频域,实现对权重相关性的全局分析。
  • 在频谱上引入软掩码,选择性保留重要频率分量,抑制噪声类高频分量。
  • 通过反向传播端到端训练变换,其中梯度通过可微变换显式控制,即使在离散化情况下也能实现有效学习。
  • 在变换后使用均匀量化器,避免复杂的混合精度或自适应量化策略。
  • 在推理阶段移除变换,仅保留标准量化器用于部署,确保与通用硬件的兼容性。

实验结果

研究问题

  • RQ1学习的频域变换是否能提升简单量化器在低比特CNN训练中的性能?
  • RQ2在频域中变换权重如何降低量化误差并弥合全精度与低比特模型之间的容量差距?
  • RQ3频率感知变换在低精度训练中在多大程度上改善了梯度流动?
  • RQ4所提方法是否能在极低架构或量化复杂度下实现最先进精度?
  • RQ5与直接量化相比,频域变换是否使低比特模型具备更好的泛化能力和鲁棒性?

主要发现

  • FAT在4-bit ResNet-18上实现ImageNet 70.5% top-1准确率,优于最先进方法,且无需任何超参数调优或复杂量化方案。
  • 对于4-bit MobileNet-V2,FAT实现69.2% top-1准确率,超越近期SOTA结果,且相比全精度模型计算量减少45.7倍。
  • 该方法将模型大小最多减少10倍(如3-bit ResNet-18为4.7MB),BOPs最多减少86.7倍,展现出极高的压缩效率。
  • 学习到的频率掩码抑制了大部分高频分量,有效对权重表示去噪,提升量化保真度。
  • 在移动ARM芯片上的推理结果显示,FAT后使用均匀量化器的延迟仅为398ms,显著低于LQ-Net(929ms)或APoT(857ms)等复杂量化器。
  • 理论分析证实,FAT通过利用频域中神经元间的关系,降低量化误差并实现信息量丰富的梯度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。