[论文解读] Feature Pyramid Encoding Network for Real-time Semantic Segmentation
该论文提出FPENet,一种轻量级实时语义分割网络,采用特征金字塔编码(FPE)模块,结合分组深度可分离空洞卷积,高效捕捉多尺度上下文信息,并引入相互嵌入上采样(MEU)模块,融合高层语义与低层空间细节。该方法在TITAN V GPU上仅使用0.4M参数即可实现102 FPS的推理速度,在Cityscapes数据集上达到68.0%的mIoU,优于现有实时模型的精度与速度表现。
Although current deep learning methods have achieved impressive results for semantic segmentation, they incur high computational costs and have a huge number of parameters. For real-time applications, inference speed and memory usage are two important factors. To address the challenge, we propose a lightweight feature pyramid encoding network (FPENet) to make a good trade-off between accuracy and speed. Specifically, we use a feature pyramid encoding block to encode multi-scale contextual features with depthwise dilated convolutions in all stages of the encoder. A mutual embedding upsample module is introduced in the decoder to aggregate the high-level semantic features and low-level spatial details efficiently. The proposed network outperforms existing real-time methods with fewer parameters and improved inference speed on the Cityscapes and CamVid benchmark datasets. Specifically, FPENet achieves 68.0\% mean IoU on the Cityscapes test set with only 0.4M parameters and 102 FPS speed on an NVIDIA TITAN V GPU.
研究动机与目标
- 为解决当前最先进语义分割模型计算成本高、参数量大的问题,以促进其在实时场景中的部署。
- 通过保留轻量化解码器中丢失的细粒度空间细节,提升实时分割的精度。
- 通过高效的多尺度特征编码与特征融合,降低模型复杂度,同时保持或提升性能。
- 在基准数据集上实现推理速度、模型大小与分割精度之间的更优权衡。
提出的方法
- FPE模块采用不同空洞率的分组深度可分离空洞卷积,构建空间金字塔结构,以较低计算成本捕捉多尺度上下文特征。
- 每个FPE模块被集成到编码器的每一阶段,使网络在所有层次上均能实现多尺度特征学习。
- MEU模块通过利用高层特征的全局上下文信息引导低层特征,并同时将局部空间细节注入高层特征,实现相互嵌入式特征融合。
- FPE模块中采用深度可分离卷积,以减少参数数量并加速推理。
- 网络采用类似U-Net的编码器-解码器结构,其中编码器使用FPE模块,解码器使用MEU模块进行特征融合。
- 模型采用交叉熵损失进行端到端训练,并在Cityscapes和CamVid数据集上按照标准协议进行评估。
实验结果
研究问题
- RQ1轻量级网络是否能在保持实时推理速度的同时实现高精度语义分割?
- RQ2分组深度可分离空洞卷积在实现多尺度上下文编码时,是否能以极低的参数增长实现高效编码?
- RQ3高层与低层特征之间的相互嵌入式特征融合,是否能在不增加模型复杂度的前提下提升边界分割精度?
- RQ4在编码器每个阶段集成多尺度特征编码,是否相比仅在后期阶段使用金字塔模块能带来性能提升?
主要发现
- FPENet在Cityscapes测试集上以102 FPS的速度仅使用0.4M参数即可达到68.0%的mIoU,精度与速度均优于现有实时模型。
- 在1536×768分辨率下,FPENet在Cityscapes上达到70.1%的mIoU,表明其在更高输入分辨率下仍具备强大性能。
- 在CamVid数据集上,FPENet实现65.4%的mIoU与89.6%的全局准确率,尽管仅含0.4M参数,仍优于BiSeNet1与Bayesian SegNet等模型。
- 消融实验表明,FPE模块通过增强感受野与层间信息流动,显著提升了模型精度。
- MEU模块有效融合了语义与空间特征,使分割边界更清晰,性能优于简单上采样或浅层特征融合方法。
- FPENet的参数量仅为BiSeNet1与ICNet的1/14至1/19,同时保持了具有竞争力的mIoU,充分证明了其在模型压缩方面的高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。