[论文解读] Training Bit Fully Convolutional Network for Fast Semantic Segmentation
该论文提出Bit全卷积网络(BFCN),一种低比特宽度全卷积网络,采用1-bit权重和2-bit激活,通过位卷积运算实现快速语义分割。通过将32位浮点运算替换为按位运算和popcount计算,BFCN在CPU上实现7.8倍推理加速,FPGA资源占用低于1%,同时保持了具有竞争力的性能,在PASCAL VOC 2012上达到62.8%的平均IoU,在Cityscapes上达到57.4%,与全精度模型相当。
Fully convolutional neural networks give accurate, per-pixel prediction for input images and have applications like semantic segmentation. However, a typical FCN usually requires lots of floating point computation and large run-time memory, which effectively limits its usability. We propose a method to train Bit Fully Convolution Network (BFCN), a fully convolutional neural network that has low bit-width weights and activations. Because most of its computation-intensive convolutions are accomplished between low bit-width numbers, a BFCN can be accelerated by an efficient bit-convolution implementation. On CPU, the dot product operation between two bit vectors can be reduced to bitwise operations and popcounts, which can offer much higher throughput than 32-bit multiplications and additions. To validate the effectiveness of BFCN, we conduct experiments on the PASCAL VOC 2012 semantic segmentation task and Cityscapes. Our BFCN with 1-bit weights and 2-bit activations, which runs 7.8x faster on CPU or requires less than 1\% resources on FPGA, can achieve comparable performance as the 32-bit counterpart.
研究动机与目标
- 为解决全卷积网络(FCNs)在实时和嵌入式应用中计算和内存需求高的问题。
- 通过权重和激活的低比特宽度量化,实现在CPU和FPGA等资源受限设备上的高效推理。
- 开发一种新型训练策略,最小化量化带来的性能下降,适用于语义分割任务。
- 证明低比特FCN可在大幅减少模型大小和推理延迟的同时,实现具有竞争力的准确率。
提出的方法
- BFCN采用1-bit权重和2-bit激活,通过XNOR和popcount运算替代浮点乘法进行计算。
- 使用按位异或(XOR)和人口计数(popcount)运算实现位卷积核,以加速CPU和FPGA上的推理。
- 在重建路径中采用残差块,以在低比特宽度设置下更好地保留特征表示。
- 在训练过程中引入线性比特宽度衰减调度,将比特宽度从8位逐步降低至1或2位,以稳定训练并减少量化误差。
- 从ImageNet预训练的ResNet-50模型微调,采用权重和激活的边界约束,以改善收敛性和性能。
- 该框架支持与其他加速技术(如低秩近似和CRF后处理)的集成。
实验结果
研究问题
- RQ1全卷积网络能否在1-bit权重和2-bit激活下被有效量化,而语义分割性能下降不显著?
- RQ2如何有效训练低比特宽度网络,以最小化量化带来的性能下降?
- RQ3与标准32位运算相比,位卷积运算在CPU和FPGA上能实现多大程度的推理加速?
- RQ4与标准二值化网络相比,残差块和比特宽度衰减是否能提升低比特FCN的性能?
- RQ5低比特FCN能否在PASCAL VOC 2012和Cityscapes等复杂数据集上保持具有竞争力的准确率,同时大幅减少模型大小和延迟?
主要发现
- 1-2 BFCN在PASCAL VOC 2012上达到62.8%的平均IoU,在Cityscapes上达到57.4%,分别比32位基线模型低7.4%和7.8%。
- 在CPU上,1-2 BFCN的推理速度比32位模型快7.8倍,Tegra K1上的推理时间从9681 ms降低至1237 ms。
- 1-2 BFCN仅需4.3 MB参数存储空间,相比32位模型的137.7 MB减少了32倍。
- 在FPGA上,1-2 BFCN的资源消耗低于32位模型所需资源的1%,展现出极强的硬件效率。
- 采用残差重建和线性比特宽度衰减的2-bit BFCN在VOC 2012上达到67.0%的平均IoU,比基线变体提升7.4%。
- 性能下降最显著出现在细粒度和罕见类别上(如bottle、sofa、train),而大而常见的类别(如sky、car)仍保持高度准确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。