Skip to main content
QUICK REVIEW

[论文解读] Few-shot Semantic Segmentation with Self-supervision from Pseudo-classes

Yiwen Li, Gratianus Wesley Putra Data|arXiv (Cornell University)|Oct 22, 2021
Domain Adaptation and Few-Shot Learning参考文献 29被引用 9
一句话总结

本文提出一种自监督少样本语义分割方法,通过从查询图像背景的高激活超像素中生成伪类别,以提升模型在未见类别上的泛化能力。通过训练模型区分这些伪类别与背景,实现了显著的性能提升——在 COCO 5-shot 上平均IoU最高提升 6.7%,在 PASCAL-5i 1-shot 上提升 5.1%,尤其在包含多个物体类别的图像中显著提高了分割精度。

ABSTRACT

Despite the success of deep learning methods for semantic segmentation, few-shot semantic segmentation remains a challenging task due to the limited training data and the generalisation requirement for unseen classes. While recent progress has been particularly encouraging, we discover that existing methods tend to have poor performance in terms of meanIoU when query images contain other semantic classes besides the target class. To address this issue, we propose a novel self-supervised task that generates random pseudo-classes in the background of the query images, providing extra training data that would otherwise be unavailable when predicting individual target classes. To that end, we adopted superpixel segmentation for generating the pseudo-classes. With this extra supervision, we improved the meanIoU performance of the state-of-the-art method by 2.5% and 5.1% on the one-shot tasks, as well as 6.7% and 4.4% on the five-shot tasks, on the PASCAL-5i and COCO benchmarks, respectively.

研究动机与目标

  • 解决当查询图像中包含目标类别以外的多个物体类别时,少样本语义分割性能下降的问题。
  • 缓解现有少样本分割方法中背景类别监督不足的问题,这些方法将所有非目标像素视为统一背景。
  • 通过从查询图像背景的超像素分割中衍生出的自监督训练信号,提升模型泛化能力。
  • 证明学习区分非目标类别可增强特征解耦,提升对未见类别的分割精度。
  • 通过在训练期间遮蔽测试类别像素,验证方法对新类别的鲁棒性,结果仅出现轻微性能下降。

提出的方法

  • 该方法通过识别特征图中激活分数较高的查询图像背景超像素来生成伪类别。
  • 在每个训练任务中,从激活值最高的前 5 个超像素中形成一个伪类别,生成额外的图像-掩码对用于自监督训练。
  • 自监督损失通过可学习超参数 α 进行缩放,以平衡伪监督与真实监督之间的关系。
  • 模型通过结合目标类别上的标准分割损失和伪类别上的自监督损失进行训练。
  • 使用超像素分割以确保空间一致性,并减少与随机像素采样相比的过分割伪影。
  • 该方法与网络架构无关,可通过添加自监督头,应用于任何少样本分割模型,如 PFENet 或 PANet。

实验结果

研究问题

  • RQ1当查询图像中存在多个物体类别时,是否会导致少样本语义分割性能下降?如果是,原因是什么?
  • RQ2能否通过从背景超像素中衍生出的自监督伪类别,提升少样本分割模型在未见类别上的泛化能力?
  • RQ3伪类别采样策略的选择(如 top-1、top-5、随机采样)如何影响性能与鲁棒性?
  • RQ4当支持集中不包含非目标类别时,模型在学习区分这些类别方面能获得多大程度的收益?
  • RQ5即使在训练数据中遮蔽了这些类别的像素,自监督信号是否仍能泛化到完全新颖的类别?

主要发现

  • 与最先进方法 PFENet 相比,所提方法在 PASCAL-5i 1-shot 基准上将平均IoU提升了 5.1%,在 COCO 5-shot 基准上提升了 6.7%。
  • top-5 超像素采样策略优于 top-1 和随机采样,在 ResNet-50 PFENet 上实现了 63.2% 的平均IoU(PASCAL-5i 1-shot)。
  • 在训练期间遮蔽测试类别像素仅导致 PFENet 性能下降 0.4%,表明对未见类别的泛化能力极强。
  • 最优的自监督损失缩放因子 α 为 0.5,可在伪标签不准确性与有效监督之间实现最佳平衡。
  • 该方法缓解了类别间的性能不平衡问题,并改善了嵌入空间中的特征解耦。
  • 消融实验证实,性能提升源于对背景表示学习的改进,而非数据泄露或与测试类别重叠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。