Skip to main content
QUICK REVIEW

[论文解读] Performance Guaranteed Network Acceleration via High-Order Residual Quantization

Zefan Li, Bingbing Ni|arXiv (Cornell University)|Aug 29, 2017
Sparse and Compressive Sensing Techniques参考文献 20被引用 19
一句话总结

本文提出了一种新型二值化近似方法——高阶残差量化(HORQ),通过递归应用阈值化来减少深度神经网络中的量化误差。通过在递减的幅值尺度上生成多个二值特征图,并结合高阶二值滤波,HORQ在仅造成轻微精度下降的情况下实现了高达30倍的加速,相较于XNOR-Net在CIFAR-10上提升约3%,在MNIST上提升0.71%,同时保持32倍的模型压缩率。

ABSTRACT

Input binarization has shown to be an effective way for network acceleration. However, previous binarization scheme could be regarded as simple pixel-wise thresholding operations (i.e., order-one approximation) and suffers a big accuracy loss. In this paper, we propose a highorder binarization scheme, which achieves more accurate approximation while still possesses the advantage of binary operation. In particular, the proposed scheme recursively performs residual quantization and yields a series of binary input images with decreasing magnitude scales. Accordingly, we propose high-order binary filtering and gradient propagation operations for both forward and backward computations. Theoretical analysis shows approximation error guarantee property of proposed method. Extensive experimental results demonstrate that the proposed scheme yields great recognition accuracy while being accelerated.

研究动机与目标

  • 为解决深度神经网络中一阶二值化导致的显著精度下降问题。
  • 开发一种二值量化方案,在保持高近似精度的同时支持高效的二值计算。
  • 为所提出的量化框架提供理论误差保证。
  • 实现在CPU上部署深度网络时性能损失最小化的实际应用。

提出的方法

  • 提出高阶残差量化(HORQ),通过递归对残差误差应用阈值化,在递减的幅值尺度上生成多个二值特征图。
  • 引入高阶二值滤波与梯度传播操作,支持仅使用二值运算的前向与反向计算。
  • 采用递归残差分解:在第K阶时,输入被近似为K个二值图与一个残差的和,每一阶段均对近似进行优化。
  • 推导出近似误差的理论边界,表明随着量化阶数增加,该方法可保证误差减少。
  • 使用二值权重与二值激活图,实现32倍的模型压缩率,并在现代CPU上每周期仅使用64位二值运算完成计算。
  • 将该方法应用于标准卷积层,其中最终输出为各残差阶段输出的总和。

实验结果

研究问题

  • RQ1递归残差量化是否能超越一阶阈值化,在二值神经网络中进一步降低近似误差?
  • RQ2高阶二值运算是否能在实现显著加速的同时保持高精度?
  • RQ3所提出的高阶残差量化方案的理论误差边界是什么?
  • RQ4加速比如何随滤波器大小、通道数和量化阶数变化?
  • RQ5HORQ是否能在精度与效率两方面均优于现有二值化方法(如XNOR-Net)?

主要发现

  • HORQ-Net平均实现30倍加速,在最优条件下(64×256通道,3×3滤波器)达到31.98倍加速。
  • 该方法提供了理论误差保证,表明随着量化阶数增加,近似误差持续减少。
  • 在CIFAR-10上,HORQ-Net的Top-1精度比XNOR-Net高出约3%。
  • 在MNIST上,HORQ-Net的精度比XNOR-Net高出0.71%。
  • 通过使用二值权重,模型实现约32倍的压缩率,显著降低存储需求。
  • 对于二阶与三阶量化,加速比仍保持在20倍以上,具备实际部署可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。