Skip to main content
QUICK REVIEW

[论文解读] Generalized Few-Shot Semantic Segmentation: All You Need is Fine-Tuning

Josh Myers-Dean, Yinan Zhao|arXiv (Cornell University)|Dec 21, 2021
Domain Adaptation and Few-Shot Learning被引用 8
一句话总结

本文提出了一种用于广义少样本语义分割的简单两阶段微调方法,表明在冻结特征提取器的同时微调分类器头,可在 PASCAL-5i 和 COCO-20i 上实现最先进性能。此外,结果表明三元组损失正则化可改善基础类与新类之间的性能平衡,消除先前元学习方法中观察到的性能饱和现象。

ABSTRACT

Generalized few-shot semantic segmentation was introduced to move beyond only evaluating few-shot segmentation models on novel classes to include testing their ability to remember base classes. While the current state-of-the-art approach is based on meta-learning, it performs poorly and saturates in learning after observing only a few shots. We propose the first fine-tuning solution, and demonstrate that it addresses the saturation problem while achieving state-of-the-art results on two datasets, PASCAL-5i and COCO-20i. We also show that it outperforms existing methods, whether fine-tuning multiple final layers or only the final layer. Finally, we present a triplet loss regularization that shows how to redistribute the balance of performance between novel and base categories so that there is a smaller gap between them.

研究动机与目标

  • 解决现有基于元学习的广义少样本语义分割模型存在的性能饱和与泛化能力差的问题。
  • 探究在其他少样本学习任务中表现成功的微调方法是否在广义少样本语义分割中同样有效。
  • 评估微调不同网络组件(例如仅最后一层 vs. 所有层)对模型性能的影响。
  • 探索三元组损失正则化是否能实现基础类与新类之间性能的再平衡。
  • 通过简单且可扩展的微调方法建立广义少样本语义分割的新最先进基线。

提出的方法

  • 该方法采用两阶段训练流程:首先在标注丰富的基础类上进行预训练,然后使用少样本支持集在基础类和新类上进行微调。
  • 在微调过程中,冻结分类器之前的所有层,仅使用支持集标注更新分类器头。
  • 该方法评估两种变体:仅微调最后一层(Ours-Vanilla)和微调主干网络之后的所有层(Ours-TripletAll)。
  • 引入三元组损失以显式建模像素特征之间的相似性与差异性,提升基础类与新类的特征判别能力。
  • 三元组损失在微调过程中应用,以促使同一类别的特征嵌入彼此更接近,而不同类别的特征嵌入更远离。
  • 通过在 PASCAL-5i 和 COCO-20i 上计算 mIoU 来评估性能,涵盖 1、5、10 和 100-shot 设置。

实验结果

研究问题

  • RQ1简单的微调方法是否能在广义少样本语义分割中超越最先进元学习方法?
  • RQ2仅微调最终分类器层或微调主干网络之后的所有层,哪种方法性能更优?
  • RQ3三元组损失正则化是否能改善基础类与新类之间性能的平衡?
  • RQ4在微调模型中,随着样本数增加是否会出现性能饱和现象,如元学习基线中所见?
  • RQ5训练期间基础类与新类的比例如何影响模型泛化能力与性能平衡?

主要发现

  • 所提出的微调方法在 PASCAL-5i 和 COCO-20i 上均实现了新的最先进 mIoU,优于先前的元学习基线 GFS-Seg。
  • 该方法未出现性能饱和现象,mIoU 从 1 到 10 张样本稳步提升,而 GFS-Seg 仅提升了 0.3 个百分点。
  • 微调主干网络之后的所有层(Ours-TripletAll)的性能优于仅微调最后一层,尤其在平衡基础类与新类性能方面表现更优。
  • 三元组损失正则化降低了基础类与新类之间的性能差距,提升了新类的 mIoU,同时保持了对基础类的强性能。
  • 使用余弦相似度进行对比学习(Ours-Cosine)相较于原始微调基线,在 5 和 10 张样本设置下,总 mIoU 分别下降了 1.04 和 5.39 个百分点。
  • 随着新类比例增加,性能下降,主要由于基础类性能下降,表明模型对训练阶段的类别分布敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。