Skip to main content
QUICK REVIEW

[论文解读] See More Than Once -- Kernel-Sharing Atrous Convolution for Semantic Segmentation

Ye Huang, Qingqing Wang|arXiv (Cornell University)|Aug 26, 2019
Advanced Neural Network Applications参考文献 27被引用 13
一句话总结

本文提出了一种新型语义分割模块——核共享空洞卷积(KSAC),其多个并行分支采用不同的空洞率但共享同一个卷积核,使单个卷积核能够通过多次扫描输入特征图,以不同感受野‘观察’特征图。该设计在减少33%参数量的同时,将PASCAL VOC 2012数据集上的mIOU提升0.6%(使用MobileNetV2)和2.62%(使用Xception),且不增加模型大小或推理成本。

ABSTRACT

The state-of-the-art semantic segmentation solutions usually leverage different receptive fields via multiple parallel branches to handle objects with different sizes. However, employing separate kernels for individual branches degrades the generalization and representation abilities of the network, and the number of parameters increases linearly in the number of branches. To tackle this problem, we propose a novel network structure namely Kernel-Sharing Atrous Convolution (KSAC), where branches of different receptive fields share the same kernel, i.e., let a single kernel see the input feature maps more than once with different receptive fields, to facilitate communication among branches and perform feature augmentation inside the network. Experiments conducted on the benchmark PASCAL VOC 2012 dataset show that the proposed sharing strategy can not only boost a network s generalization and representation abilities but also reduce the model complexity significantly. Specifically, on the validation set, whe compared with DeepLabV3+ equipped with MobileNetv2 backbone, 33% of parameters are reduced together with an mIOU improvement of 0.6%. When Xception is used as the backbone, the mIOU is elevated from 83.34% to 85.96% with about 10M parameters saved. In addition, different from the widely used ASPP structure, our proposed KSAC is able to further improve the mIOU by taking benefit of wider context with larger atrous rates. Finally, our KSAC achieves mIOUs of 88.1% and 45.47% on the PASCAL VOC 2012 test set and ADE20K dataset, respectively. Our full code will be released on the Github.

研究动机与目标

  • 为解决并行多分支网络在语义分割中的局限性,如分支间通信能力差以及参数量随分支数量线性增长的问题。
  • 通过让单个卷积核在多次扫描同一输入特征图的过程中学习不同感受野的特征,提升模型的泛化能力与表征能力。
  • 在保持或提升基准数据集(如PASCAL VOC 2012和ADE20K)性能的前提下,降低模型复杂度与推理成本。
  • 实现对更大空洞率(如24)的有效利用,以获取更广的上下文感受野,且不增加参数量,从而克服标准ASPP中因空洞率过大导致的性能下降问题。

提出的方法

  • KSAC在多个并行分支中引入共享卷积核,每个分支对同一输入特征图应用相同的3×3卷积核,但采用不同的空洞率。
  • 共享卷积核在不同分支中依次作用于同一输入特征图,使模型能在单次前向传播中同时学习局部与全局特征。
  • 该机制实现了跨尺度的特征交互,同时增加了每个卷积核的有效训练样本数,从而提升特征表征能力。
  • 该方法支持在不增加参数量的前提下添加具有更大空洞率(如24)的新分支,因为所有分支共享同一卷积核。
  • KSAC可无缝集成至DeepLabV3+等现有网络架构中,并可在TensorFlow 2.0等标准深度学习框架中部署。
  • 模型在输出步长为16的设置下进行训练与评估,相比OS=8设置,实现了更低的显存占用与更快的推理速度,同时保持高性能。

实验结果

研究问题

  • RQ1在多个空洞率分支中使用单个共享卷积核,是否能提升语义分割中的特征表征能力与泛化性能?
  • RQ2卷积核共享是否能在保持或提升分割准确率的同时降低模型复杂度?
  • RQ3KSAC能否在不增加参数量或性能下降的前提下,有效利用更大的空洞率(如24)以获取更广的上下文感受野?
  • RQ4在PASCAL VOC 2012与ADE20K数据集上,KSAC相较于标准ASPP在mIOU、参数量与推理效率方面表现如何?
  • RQ5KSAC是否能在输出步长为16的设置下实现高性能,同时避免OS=8设置带来的速度损失与显存增加?

主要发现

  • 在PASCAL VOC 2012数据集上使用MobileNetV2时,KSAC将参数量减少33%(从4.5M降至3.0M),mIOU提升0.6%(从75.70%增至76.30%)。
  • 使用Xception作为主干网络时,KSAC将参数量减少约1000万(从5430万降至4480万),mIOU从83.34%提升至85.96%。
  • 通过增加一个空洞率为24的分支,KSAC在不增加参数量的前提下,进一步将mIOU提升至87.01%,较DeepLabV3+高出3.67%。
  • 在PASCAL VOC 2012测试集上,KSAC实现了88.1%的mIOU,优于当前最先进方法如DeepLabV3+(87.8%)与ExFuse(87.9%)。
  • 在ADE20K数据集上,KSAC在多尺度测试下达到45.47%的mIOU,优于所有列出的基线方法,包括CFNet(44.89%)与EncNet(44.65%)。
  • KSAC在输出步长为16的设置下实现了高性能,避免了OS=8设置下通常伴随的3倍速度损失与4倍GPU显存增加,因而更加高效且节省显存。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。