Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Total Variation Loss for Semi-supervised Deep Learning of Semantic Segmentation

Mehran Javanmardi, Mehdi S. M. Sajjadi|arXiv (Cornell University)|May 4, 2016
Advanced Neural Network Applications参考文献 32被引用 13
一句话总结

本文提出一种无监督总变差(TV)损失,用于在弱监督深度学习中正则化语义分割,通过空间梯度的l1-范数强制预测的标签概率图呈现分段平滑性。该方法将TV损失与监督交叉熵损失结合,在PASCAL、Sift Flow和NYUv2数据集上显著提升了精度,尤其在标签稀疏的情况下表现优异,优于纯监督模型以及使用CRF后处理的方法。

ABSTRACT

We introduce a novel unsupervised loss function for learning semantic segmentation with deep convolutional neural nets (ConvNet) when densely labeled training images are not available. More specifically, the proposed loss function penalizes the L1-norm of the gradient of the label probability vector image , i.e. total variation, produced by the ConvNet. This can be seen as a regularization term that promotes piecewise smoothness of the label probability vector image produced by the ConvNet during learning. The unsupervised loss function is combined with a supervised loss in a semi-supervised setting to learn ConvNets that can achieve high semantic segmentation accuracy even when only a tiny percentage of the pixels in the training images are labeled. We demonstrate significant improvements over the purely supervised setting in the Weizmann horse, Stanford background and Sift Flow datasets. Furthermore, we show that using the proposed piecewise smoothness constraint in the learning phase significantly outperforms post-processing results from a purely supervised approach with Markov Random Fields (MRF). Finally, we note that the framework we introduce is general and can be used to learn to label other types of structures such as curvilinear structures by modifying the unsupervised loss function accordingly.

研究动机与目标

  • 通过利用稀疏像素级标注实现有效学习,解决语义分割中高数据标注成本的挑战。
  • 克服仅使用少量像素标注时纯监督深度学习方法的局限性。
  • 开发一种可泛化的无监督损失函数,利用图像的自然属性(如分段平滑性)提升模型泛化能力。
  • 证明通过总变差实现的空间正则化可优于弱监督设置下的后处理CRF优化。
  • 通过可反向传播的损失函数引入结构先验,使深度神经网络在低数据环境下收敛至更优解。

提出的方法

  • 提出一种无监督总变差(TV)损失,通过惩罚预测标签概率图在空间维度上的梯度l1-范数来实现。
  • 将TV损失作为正则化项整合进训练目标,与标准的监督交叉熵损失联合优化,用于像素级分类。
  • 使用反向传播端到端训练全卷积网络(FCNs),其中TV损失可微分,并与监督损失联合优化。
  • 在弱监督设置下应用该方法,即每张图像仅少量像素被标注,其余像素用于无监督TV损失。
  • 利用TV损失隐式建模空间上下文,并在预测的分割图中强制实现平滑性,模拟CRF中的成对势能。
  • 在三个基准数据集(PASCAL、Sift Flow、NYUv2)上进行训练,标签稀疏度范围为0.03%至0.07%,以评估泛化性能。

实验结果

研究问题

  • RQ1在仅少量像素被标注的情况下,通过总变差损失强制实现空间平滑性是否能提升语义分割精度?
  • RQ2在标签稀疏条件下,所提出的无监督TV损失与纯监督训练及CRF后处理相比,分割精度表现如何?
  • RQ3当标注数据极度有限时,TV损失是否有助于模型收敛至解空间中的更优极小值?
  • RQ4在使用稀疏监督时,由于类别标签不平衡,TV损失是否导致罕见类别性能显著下降?
  • RQ5通过调整基于导数的正则化,该损失是否可推广至其他图像结构(如管状或曲线状特征)?

主要发现

  • 在PASCAL VOC 2012数据集上,仅使用0.03%标注像素时,弱监督方法达到31.92%的平均IoU,优于纯监督基线的28.80%。
  • 在Sift Flow数据集上,每张图像仅10个标注像素时,所提方法达到58.19%的平均每类准确率,而纯监督方法仅为48.53%。
  • 该方法在相同监督基线上的CRF后处理中表现显著更优,证明网络内正则化比后处理优化更有效。
  • 在NYUv2数据集上,弱监督方法在0.03%标注像素下达到34.26%的平均IoU,而纯监督方法为31.92%。
  • 在Sift Flow数据集中,性能提升在前10个最常见类别上最为显著,当每张图像有30个标注像素时,弱监督方法准确率最高达60.38%。
  • 尽管由于标注稀缺,罕见类别整体准确率有所下降,但TV损失有效稳定了学习过程,并提升了主要类别上的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。