[论文解读] Computation Error Analysis of Block Floating Point Arithmetic Oriented Convolution Neural Network Accelerator Design
本文提出了一种基于块浮点(BFP)算术的CNN加速器,用高效的定点计算替代传统的浮点运算,在不微调的情况下,于VGG16、ResNet-18、ResNet-50和GoogLeNet上实现小于0.3%的精度损失,且尾数为8位。该工作提出了一种理论噪声-信号比(NSR)上限模型,用于指导硬件设计,并在有限字长约束下验证精度。
The heavy burdens of computation and off-chip traffic impede deploying the large scale convolution neural network on embedded platforms. As CNN is attributed to the strong endurance to computation errors, employing block floating point (BFP) arithmetics in CNN accelerators could save the hardware cost and data traffics efficiently, while maintaining the classification accuracy. In this paper, we verify the effects of word width definitions in BFP to the CNN performance without retraining. Several typical CNN models, including VGG16, ResNet-18, ResNet-50 and GoogLeNet, were tested in this paper. Experiments revealed that 8-bit mantissa, including sign bit, in BFP representation merely induced less than 0.3% accuracy loss. In addition, we investigate the computational errors in theory and develop the noise-to-signal ratio (NSR) upper bound, which provides the promising guidance for BFP based CNN engine design.
研究动机与目标
- 降低嵌入式平台中CNN加速器的计算与内存开销。
- 在不微调的情况下,通过块浮点(BFP)算术实现大规模CNN的高效硬件部署。
- 分析并建模有限精度BFP算术在CNN中引入的计算误差。
- 为BFP-based CNN加速器的设计提供理论NSR上限模型。
- 在多种深度CNN架构上验证BFP表示的精度与效率。
提出的方法
- 采用块浮点(BFP)表示,其中块内数字共享同一个指数,从而降低计算复杂度。
- 在BFP格式中使用8位尾数(含符号位)表示激活值和权重,以最小化硬件开销与数据流量。
- 建立理论噪声-信号比(NSR)上限模型,以量化并约束有限精度BFP算术带来的计算误差。
- 在VGG16、ResNet-18、ResNet-50、GoogLeNet、MNIST和CIFAR-10上进行实验评估,以单精度浮点为参考。
- 通过比较BFP输出与单精度浮点输出在各层的信号-噪声比(SNR),测量实验SNR,以验证理论NSR模型。
- 评估ReLU和池化层对SNR的影响,确认ReLU不降低SNR,且池化层保持了信号能量分布。
实验结果
研究问题
- RQ1在不微调的情况下,使用8位尾数的BFP表示对大规模CNN的最大精度损失是多少?
- RQ2理论NSR上限模型在预测BFP-based CNN推理中实际信噪比时的准确性如何?
- RQ3ReLU和池化层在多大程度上影响BFP算术中的SNR,其影响是否与理论假设一致?
- RQ4BFP表示能否在VGG16、ResNet和GoogLeNet等多样化CNN架构中保持高精度,同时硬件开销极低?
- RQ5特征图的能量分布如何影响BFP算术中的SNR,特别是在早期层中?
主要发现
- 在不微调的情况下,BFP表示中使用8位尾数在VGG16、ResNet-18、ResNet-50和GoogLeNet上均实现小于0.3%的精度损失。
- 理论NSR上限模型与实验结果的最大偏差小于8.9 dB,验证了其在硬件设计中的准确性。
- ReLU层保持了SNR,表明输出分布的对称性在BFP量化下得以良好保留。
- 池化层保持了模型假设中的信号能量分布,证实了理论SNR分析的鲁棒性。
- 分层能量分布分析表明,第'conv1_2'层的能量在高幅值处最集中,表明其与量化具有更强的相关性,且对量化更敏感。
- 所提出的BFP加速器通过将浮点运算替换为定点运算,显著降低了硬件复杂度与片外数据流量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。