Skip to main content
QUICK REVIEW

[论文解读] Training Bit Fully Convolutional Network for Fast Semantic Segmentation

He Wen, Shuchang Zhou|arXiv (Cornell University)|Dec 1, 2016
Advanced Neural Network Applications参考文献 27被引用 8
一句话总结

该论文提出Bit全卷积网络(BFCN),一种低比特宽度全卷积网络,采用1-bit权重和2-bit激活,通过位卷积运算实现快速语义分割。通过将32位浮点运算替换为按位运算和popcount计算,BFCN在CPU上实现7.8倍推理加速,FPGA资源占用低于1%,同时保持了具有竞争力的性能,在PASCAL VOC 2012上达到62.8%的平均IoU,在Cityscapes上达到57.4%,与全精度模型相当。

ABSTRACT

Fully convolutional neural networks give accurate, per-pixel prediction for input images and have applications like semantic segmentation. However, a typical FCN usually requires lots of floating point computation and large run-time memory, which effectively limits its usability. We propose a method to train Bit Fully Convolution Network (BFCN), a fully convolutional neural network that has low bit-width weights and activations. Because most of its computation-intensive convolutions are accomplished between low bit-width numbers, a BFCN can be accelerated by an efficient bit-convolution implementation. On CPU, the dot product operation between two bit vectors can be reduced to bitwise operations and popcounts, which can offer much higher throughput than 32-bit multiplications and additions. To validate the effectiveness of BFCN, we conduct experiments on the PASCAL VOC 2012 semantic segmentation task and Cityscapes. Our BFCN with 1-bit weights and 2-bit activations, which runs 7.8x faster on CPU or requires less than 1\% resources on FPGA, can achieve comparable performance as the 32-bit counterpart.

研究动机与目标

  • 为解决全卷积网络(FCNs)在实时和嵌入式应用中计算和内存需求高的问题。
  • 通过权重和激活的低比特宽度量化,实现在CPU和FPGA等资源受限设备上的高效推理。
  • 开发一种新型训练策略,最小化量化带来的性能下降,适用于语义分割任务。
  • 证明低比特FCN可在大幅减少模型大小和推理延迟的同时,实现具有竞争力的准确率。

提出的方法

  • BFCN采用1-bit权重和2-bit激活,通过XNOR和popcount运算替代浮点乘法进行计算。
  • 使用按位异或(XOR)和人口计数(popcount)运算实现位卷积核,以加速CPU和FPGA上的推理。
  • 在重建路径中采用残差块,以在低比特宽度设置下更好地保留特征表示。
  • 在训练过程中引入线性比特宽度衰减调度,将比特宽度从8位逐步降低至1或2位,以稳定训练并减少量化误差。
  • 从ImageNet预训练的ResNet-50模型微调,采用权重和激活的边界约束,以改善收敛性和性能。
  • 该框架支持与其他加速技术(如低秩近似和CRF后处理)的集成。

实验结果

研究问题

  • RQ1全卷积网络能否在1-bit权重和2-bit激活下被有效量化,而语义分割性能下降不显著?
  • RQ2如何有效训练低比特宽度网络,以最小化量化带来的性能下降?
  • RQ3与标准32位运算相比,位卷积运算在CPU和FPGA上能实现多大程度的推理加速?
  • RQ4与标准二值化网络相比,残差块和比特宽度衰减是否能提升低比特FCN的性能?
  • RQ5低比特FCN能否在PASCAL VOC 2012和Cityscapes等复杂数据集上保持具有竞争力的准确率,同时大幅减少模型大小和延迟?

主要发现

  • 1-2 BFCN在PASCAL VOC 2012上达到62.8%的平均IoU,在Cityscapes上达到57.4%,分别比32位基线模型低7.4%和7.8%。
  • 在CPU上,1-2 BFCN的推理速度比32位模型快7.8倍,Tegra K1上的推理时间从9681 ms降低至1237 ms。
  • 1-2 BFCN仅需4.3 MB参数存储空间,相比32位模型的137.7 MB减少了32倍。
  • 在FPGA上,1-2 BFCN的资源消耗低于32位模型所需资源的1%,展现出极强的硬件效率。
  • 采用残差重建和线性比特宽度衰减的2-bit BFCN在VOC 2012上达到67.0%的平均IoU,比基线变体提升7.4%。
  • 性能下降最显著出现在细粒度和罕见类别上(如bottle、sofa、train),而大而常见的类别(如sky、car)仍保持高度准确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。