Skip to main content
QUICK REVIEW

[论文解读] Superpixel Convolutional Networks using Bilateral Inceptions

Raghudeep Gadde, Varun Jampani|arXiv (Cornell University)|Nov 20, 2015
Advanced Neural Network Applications参考文献 29被引用 4
一句话总结

本文提出双边倒数(Bilateral Inception, BI)模块——一种可学习的、边缘感知的滤波器,用于在卷积神经网络(CNN)中跨多个尺度在超像素之间传播特征,以实现语义分割。通过在1×1卷积层之间插入BI模块,该方法在保持全分辨率输出和更快推理速度的同时,提升了基线CNN和DenseCRF的分割精度。

ABSTRACT

In this paper we propose a CNN architecture for semantic image segmentation. We introduce a new 'bilateral inception' module that can be inserted in existing CNN architectures and performs bilateral filtering, at multiple feature-scales, between superpixels in an image. The feature spaces for bilateral filtering and other parameters of the module are learned end-to-end using standard backpropagation techniques. The bilateral inception module addresses two issues that arise with general CNN segmentation architectures. First, this module propagates information between (super) pixels while respecting image edges, thus using the structured information of the problem for improved results. Second, the layer recovers a full resolution segmentation result from the lower resolution solution of a CNN. In the experiments, we modify several existing CNN architectures by inserting our inception module between the last CNN (1x1 convolution) layers. Empirical results on three different datasets show reliable improvements not only in comparison to the baseline networks, but also in comparison to several dense-pixel prediction techniques such as CRFs, while being competitive in time.

研究动机与目标

  • 解决标准CNN在捕捉语义分割中结构化输出关系方面的局限性。
  • 通过将边缘感知的信息传播直接集成到网络架构中,克服对后处理上采样和CRF优化的依赖。
  • 利用超像素作为结构化、图像自适应的布局,以改善特征传播,同时保持空间和光度一致性。
  • 实现在CNN框架内端到端学习双边滤波参数和特征空间。
  • 在无需额外上采样或CRF后处理步骤的情况下,实现全分辨率分割输出。

提出的方法

  • 提出一种新颖的“双边倒数”(BI)模块,该模块在多个特征尺度上对超像素应用双边滤波。
  • 使用超像素作为特征传播的空间布局,替代最终层中的标准网格卷积。
  • 通过反向传播端到端学习双边滤波的特征空间和核参数。
  • 将BI模块插入现有CNN架构(如DeepLab和AlexNet)的最后1×1卷积(FC)层之间。
  • 使用高斯核执行边缘感知的信息传播,同时考虑空间接近度和颜色相似性。
  • 直接从低分辨率CNN特征恢复全分辨率分割掩码,无需插值或CRF优化。

实验结果

研究问题

  • RQ1与标准CNN和CRF后处理相比,超像素之间可学习的双边滤波是否能提升语义分割性能?
  • RQ2使用超像素作为结构化、图像自适应的布局,是否能增强特征传播并保持物体边界?
  • RQ3在CNN框架中端到端学习双边滤波参数,是否能优于固定或手工设计的CRF推理策略?
  • RQ4BI模块在多大程度上减少了语义分割中对独立上采样或CRF优化步骤的需求?
  • RQ5在基准数据集上,BI模块与DenseCRF及其他密集预测技术相比,在精度和速度方面表现如何?

主要发现

  • 当插入DeepLab模型时,BI模块在Cityscapes验证集上达到66.9%的IoU,优于基线模型(65.7%)和DeepLab + DenseCRF基线(66.6%)。
  • 在PASCAL VOC 2012数据集上,BI模块将基线DeepLab模型的IoU从半分辨率输入下的62.2%提升至63.1%,从全分辨率输入下的65.7%提升至66.9%。
  • 在测试的三个数据集(包括Cityscapes和PASCAL VOC)上,BI模块的性能均优于DenseCRF,且显著更快(例如,在Cityscapes上运行时间分别为6.1秒和6.9秒)。
  • 由于边缘感知的传播机制,该方法产生更清晰的分割边界,避免了双线性插值和部分CRF方法常见的模糊现象。
  • 运行时间的大部分归因于超像素计算(Cityscapes上为5.2秒),但BI推理本身在超像素数量上具有高效性和可扩展性。
  • BI模块具有模块化特性,可无需架构重构地插入现有CNN架构中,展现出广泛的适用性和易于集成的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。