[论文解读] Feature Selective Transformer for Semantic Image Segmentation
本文提出特征选择性Transformer(FeSeFormer),一种用于语义图像分割的新框架,通过两个关键模块增强多尺度特征融合:尺度级特征选择(SFS)用于为每个查询动态选择来自所有尺度的有用特征,全尺度特征融合(FFF)用于自适应的跨尺度注意力。FeSeFormer在四个基准测试中达到最先进性能,包括在PASCAL Context上达到58.91%的mIoU,在Cityscapes上达到84.46%。
Recently, it has attracted more and more attentions to fuse multi-scale features for semantic image segmentation. Various works were proposed to employ progressive local or global fusion, but the feature fusions are not rich enough for modeling multi-scale context features. In this work, we focus on fusing multi-scale features from Transformer-based backbones for semantic segmentation, and propose a Feature Selective Transformer (FeSeFormer), which aggregates features from all scales (or levels) for each query feature. Specifically, we first propose a Scale-level Feature Selection (SFS) module, which can choose an informative subset from the whole multi-scale feature set for each scale, where those features that are important for the current scale (or level) are selected and the redundant are discarded. Furthermore, we propose a Full-scale Feature Fusion (FFF) module, which can adaptively fuse features of all scales for queries. Based on the proposed SFS and FFF modules, we develop a Feature Selective Transformer (FeSeFormer), and evaluate our FeSeFormer on four challenging semantic segmentation benchmarks, including PASCAL Context, ADE20K, COCO-Stuff 10K, and Cityscapes, outperforming the state-of-the-art.
研究动机与目标
- 解决现有多尺度特征融合方法在语义分割中的局限性,这些方法通常依赖于固定或局部的融合模式,可能包含无关特征。
- 通过使每个查询特征能够选择性地关注所有尺度中的有用特征,而非仅相邻或预设子集,提升上下文建模能力。
- 开发一种灵活且自适应的融合机制,在不显著增加计算成本的前提下增强特征表示能力。
- 通过改进的多尺度特征集成,在主要语义分割基准测试中实现最先进性能。
提出的方法
- 提出尺度级特征选择(SFS)模块,利用可学习注意力机制,为每个查询尺度从整个多尺度特征集合中选择一组有信息量的特征,摒弃冗余特征。
- 引入全尺度特征融合(FFF)模块,使每个查询能够通过可学习的跨尺度注意力机制,关注并融合来自所有尺度的特征。
- 将SFS与FFF集成到基于Transformer的编码器-解码器框架中,采用Swin Transformer作为主干网络,并使用轻量级FCN头进行解码。
- 在高分辨率特征图上应用投影机制,以减少计算和内存开销,尤其针对最精细尺度。
- 使用比率损失优化模型,以控制所选特征的稀疏性,鼓励网络学习有意义且紧凑的特征子集。
- 在标准基准上端到端训练,使用标准数据增强和学习率调度策略,评估与消融实验的输入分辨率为480×480。
实验结果
研究问题
- RQ1与渐进式或局部融合相比,从所有多尺度特征中进行动态、全尺度特征选择是否能提升语义分割性能?
- RQ2从所有尺度中选择稀疏但有信息量的特征子集,如何影响表示质量与计算效率?
- RQ3每尺度所选特征的最优比例是多少?其对分割精度有何影响?
- RQ4在所有尺度上实现自适应融合是否优于固定或双向融合机制(如FPT或GFFNet)?
- RQ5所提出方法在具有不同场景复杂度与类别分布的多样化基准上是否具备良好的泛化能力?
主要发现
- 在PASCAL Context上,FeSeFormer达到58.91%的mIoU,较之前最先进方法提升+2.54% mIoU。
- 在ADE20K上,模型达到54.43%的mIoU,较之前最先进方法提升+1.29% mIoU。
- 在COCO-Stuff 10K上,FeSeFormer实现49.80%的mIoU,展现出在大规模、长尾数据集上的强大泛化能力。
- 在Cityscapes上,模型达到84.46%的mIoU,在该基准上创下新最先进水平,尤其在高分辨率城市场景理解方面表现优异。
- 消融研究证实,结合SFS与FFF相比基线可提升+1.6% mIoU,其中SFS模块本身带来+0.71%的进一步增益。
- 最优特征选择比例为ρ=0.6,且当α=0.4时比率损失表现最佳,表明选择性融合比全注意力更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。