Skip to main content
QUICK REVIEW

[论文解读] Boosting Few-shot Semantic Segmentation with Transformers

Guolei Sun, Yun Liu|arXiv (Cornell University)|Aug 4, 2021
Advanced Neural Network Applications参考文献 57被引用 4
一句话总结

该论文提出TRFS,一种新颖的少样本语义分割框架,通过Transformer模块实现全局上下文建模,同时利用卷积网络进行局部特征优化。通过结合基于Transformer块的全局增强模块(GEM)与采用卷积的局部增强模块(LEM),TRFS在PASCAL-5i和COCO基准上取得了最先进性能,证明了全局与局部信息在少样本分割任务中具有互补性。

ABSTRACT

Due to the fact that fully supervised semantic segmentation methods require sufficient fully-labeled data to work well and can not generalize to unseen classes, few-shot segmentation has attracted lots of research attention. Previous arts extract features from support and query images, which are processed jointly before making predictions on query images. The whole process is based on convolutional neural networks (CNN), leading to the problem that only local information is used. In this paper, we propose a TRansformer-based Few-shot Semantic segmentation method (TRFS). Specifically, our model consists of two modules: Global Enhancement Module (GEM) and Local Enhancement Module (LEM). GEM adopts transformer blocks to exploit global information, while LEM utilizes conventional convolutions to exploit local information, across query and support features. Both GEM and LEM are complementary, helping to learn better feature representations for segmenting query images. Extensive experiments on PASCAL-5i and COCO datasets show that our approach achieves new state-of-the-art performance, demonstrating its effectiveness.

研究动机与目标

  • 解决现有少样本语义分割方法仅依赖局部感受野、忽略长距离上下文关系的局限性。
  • 探究在仅有少量标注支持图像的情况下,通过Transformer进行全局上下文建模在少样本分割中的有效性。
  • 证明结合全局(基于Transformer)与局部(基于卷积)特征优化,相比单独使用任一模块,能获得更优性能。
  • 在标准少样本分割基准(包括PASCAL-5i和COCO)上实现最先进性能。

提出的方法

  • 提出双分支架构:全局增强模块(GEM)利用Transformer块中的多头自注意力机制,建模查询特征与支持特征之间的长距离依赖关系。
  • 引入局部增强模块(LEM),通过标准卷积层对像素级特征进行精细化处理,保留局部空间细节。
  • 将查询特征、支持原型特征以及先验掩码拼接为一个形状为$ H \times W \times (2C+1) $的特征图,由GEM与LEM并行处理。
  • 采用多尺度特征处理策略,通过在尺度{60, 30, 15, 8}上使用自适应平均池化,提升特征表示在不同分辨率下的鲁棒性。
  • 使用查询分割预测的交叉熵损失进行端到端训练,监督信号来自真实掩码。
  • 采用ResNet-50作为主干网络进行特征提取,随后通过GEM与LEM对特征进行拼接与优化。

实验结果

研究问题

  • RQ1当仅有少量支持图像时,通过Transformer进行全局上下文建模是否能提升少样本语义分割性能?
  • RQ2在少样本分割中,Transformer捕捉的全局信息是否与卷积网络提取的局部特征具有互补性?
  • RQ3Transformer块的数量以及多尺度处理对模型在新类别上的性能与泛化能力有何影响?
  • RQ4结合全局与局部特征优化是否能带来比单独使用任一模块更高的分割精度?

主要发现

  • 所提出的TRFS模型在PASCAL-5i数据集的1-shot设置下达到61.9的平均mIoU,优于先前最先进方法。
  • 消融实验表明,仅使用GEM或仅使用LEM时,平均mIoU分别为60.6和60.8,而两者结合后达到61.9,证明其互补性。
  • 使用3个Transformer块(L=3)的模型性能最佳,表明更深的网络可能在基础类别上过拟合,从而降低在新类别上的表现。
  • 多尺度处理逐步提升性能:从单尺度的58.6提升至四尺度的61.9,所有报告结果均采用完整尺度集{60, 30, 15, 8}。
  • 定性结果表明,TRFS即使在仅提供一张支持图像及其掩码的情况下,也能对未见的新类别生成准确的分割掩码。
  • 在COCO数据集上,TRFS也实现了最先进性能,证实其在PASCAL-5i之外的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。