Skip to main content
QUICK REVIEW

[论文解读] Convolutional Simplex Projection Network (CSPN) for Weakly Supervised Semantic Segmentation

Rania Briq, Michael Moeller|arXiv (Cornell University)|Jul 24, 2018
Advanced Neural Network Applications参考文献 15被引用 9
一句话总结

本文提出卷积单纯形投影网络(CSPN),一种新颖的可微分层,通过使用面积先验将特征图投影到概率单纯形上,以在弱监督语义分割中强制执行对象尺寸约束。将其集成到最先进模型中后,CSPN在PASCAL VOC 2012上将mIoU提升3.5个百分点,仅使用图像级标签即达到54.5%的mIoU。

ABSTRACT

Weakly supervised semantic segmentation has been a subject of increased interest due to the scarcity of fully annotated images. We introduce a new approach for solving weakly supervised semantic segmentation with deep Convolutional Neural Networks (CNNs). The method introduces a novel layer which applies simplex projection on the output of a neural network using area constraints of class objects. The proposed method is general and can be seamlessly integrated into any CNN architecture. Moreover, the projection layer allows strongly supervised models to be adapted to weakly supervised models effortlessly by substituting ground truth labels. Our experiments have shown that applying such an operation on the output of a CNN improves the accuracy of semantic segmentation in a weakly supervised setting with image-level labels.

研究动机与目标

  • 通过利用图像级标签和对象尺寸先验,解决像素级标注不可用的弱监督语义分割挑战。
  • 开发一种实用的、端到端可训练的层,直接在神经网络中强制执行尺寸约束,避免迭代优化步骤。
  • 通过集成一个确保合理对象尺寸分布的投影层,提升弱监督设置下的分割精度。
  • 通过用单纯形投影约束替换真实标签,实现强监督模型向弱监督设置的无缝迁移。

提出的方法

  • 引入一种可微分的单纯形投影层,将网络输出映射到概率单纯形,强制预测的类别概率之和为1。
  • 应用从类别特定显著图中导出的面积约束,定义投影的有效区域,确保尊重对象尺寸先验。
  • 使用阈值化显著图(τ = 1/8)定义对象区域,并据此计算每类的总面积以实现约束强制。
  • 通过Duchi等人(2008)算法在时间复杂度为线性的情况下执行投影,实现高效且可扩展地集成到任意CNN架构中。
  • 将SEC框架中的扩展损失替换为投影损失,同时保留种子损失和基于CRF的约束损失以实现边界细化。
  • 在投影后使用argmax生成最终分割图,消融实验表明使用softmax会导致性能下降。

实验结果

研究问题

  • RQ1能否设计一种可微分的、端到端的层,在无需迭代优化的情况下强制执行弱监督语义分割中的对象尺寸约束?
  • RQ2与现有基于约束的方法相比,单纯形投影在准确率和训练效率方面表现如何?
  • RQ3当与现有弱监督模型结合时,集成投影层能在多大程度上提升性能?
  • RQ4基于显著图的区域选择中,何种阈值可实现最佳分割性能?
  • RQ5所提出的层是否可无缝集成到现有CNN架构中而无需架构修改?

主要发现

  • 当CSPN层集成到SEC框架中时,在PASCAL VOC 2012验证集上,mIoU从基线的51.0%提升至54.5%。
  • mIoU提升+3.5个百分点,证明单纯形投影在无需额外监督的情况下有效强制执行对象尺寸先验。
  • 使用τ = 1/8作为显著图区域选择的阈值可获得最优结果,阈值在1/16至1/4之间时也能保持可靠性能。
  • 若省略约束损失(基于CRF),准确率会下降,表明单纯形投影本身无法替代边界感知的细化。
  • 同时添加扩展损失和投影损失会降低性能,表明过度强调尺寸约束会损害分割质量。
  • 在投影后使用softmax替代argmax会使mIoU从54.5%降至50.2%,证实在此设置下硬类别分配更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。