[论文解读] Self-Calibrated Cross Attention Network for Few-Shot Segmentation
该论文提出了一种用于少样本图像分割的自校准交叉注意力网络(SCCAN),引入了一种新颖的自校准交叉注意力(SCCA)模块,通过基于图像块的自注意力与交叉注意力融合查询特征与对齐的支持特征,有效缓解了背景不匹配和前景-背景特征纠缠问题。该方法在 COCO-20i 数据集上实现了新的 SOTA 性能,在 5-shot 设置下 mIoU 提升了 5.6%。
The key to the success of few-shot segmentation (FSS) lies in how to effectively utilize support samples. Most solutions compress support foreground (FG) features into prototypes, but lose some spatial details. Instead, others use cross attention to fuse query features with uncompressed support FG. Query FG could be fused with support FG, however, query background (BG) cannot find matched BG features in support FG, yet inevitably integrates dissimilar features. Besides, as both query FG and BG are combined with support FG, they get entangled, thereby leading to ineffective segmentation. To cope with these issues, we design a self-calibrated cross attention (SCCA) block. For efficient patch-based attention, query and support features are firstly split into patches. Then, we design a patch alignment module to align each query patch with its most similar support patch for better cross attention. Specifically, SCCA takes a query patch as Q, and groups the patches from the same query image and the aligned patches from the support image as K&V. In this way, the query BG features are fused with matched BG features (from query patches), and thus the aforementioned issues will be mitigated. Moreover, when calculating SCCA, we design a scaled-cosine mechanism to better utilize the support features for similarity calculation. Extensive experiments conducted on PASCAL-5^i and COCO-20^i demonstrate the superiority of our model, e.g., the mIoU score under 5-shot setting on COCO-20^i is 5.6%+ better than previous state-of-the-arts. The code is available at https://github.com/Sam1224/SCCAN.
研究动机与目标
- 解决现有少样本分割方法在融合查询与支持特征时存在的背景不匹配和前景-背景特征纠缠问题。
- 通过避免原型压缩,转而使用对齐的支持特征进行交叉注意力,以保留空间细节。
- 通过同时利用查询特征内部的自注意力与查询与支持特征之间的交叉注意力,增强特征融合效果。
- 通过伪掩码聚合模块和缩放余弦机制提升注意力评分,增强少样本分割的鲁棒性与准确性。
提出的方法
- SCCA 模块将查询和支持特征划分为图像块,并使用图像块对齐模块,将每个查询块与包含前景像素的最相似支持块进行匹配。
- SCCA 在查询块上计算自注意力,并在查询块与对齐的支持块之间计算交叉注意力,使来自同一查询图像的背景特征能够与匹配的支持背景特征融合。
- 引入缩放余弦机制以增强查询与支持特征之间的相似性计算,促进支持特征在交叉注意力中的更有效利用。
- 伪掩码聚合(PMA)模块通过聚合所有成对相似性得分生成鲁棒的查询掩码,相比仅使用最大相似性的方法,对噪声更不敏感。
- 完整的 SCCAN 模型集成了 SCCA 模块与一种内存高效的 Swin Transformer 主干网络,实现了计算成本更低的高效图像块注意力机制。
- 模型采用端到端的元学习范式进行训练,推理时利用支持样本对新类别进行快速适应,仅需极少的标注样本。
实验结果
研究问题
- RQ1当查询背景特征缺乏对应的支持特征时,如何减少少样本分割中的背景不匹配问题?
- RQ2自校准交叉注意力在特征融合过程中,能在多大程度上缓解前景-背景特征纠缠?
- RQ3基于图像块的对齐与缩放余弦注意力是否能提升少样本分割中交叉注意力的质量?
- RQ4所提出的伪掩码聚合模块在应对噪声注意力得分方面,与现有方法相比表现如何?
- RQ5为最大化分割精度,图像块大小与 SCCA 模块数量的最佳配置是什么?
主要发现
- 在 COCO-20i 数据集的 5-shot 设置下,所提出的 SCCAN 模型相比之前 SOTA 方法 mIoU 提升了 5.6%,达到 67.0%。
- 在 PASCAL-5i 的 1-shot 设置下,模型达到 67.0% 的 mIoU;消融实验表明,PMA、PA 和 SC 三个组件对性能提升具有逐步贡献。
- 图像块对齐模块相比基线 SCCA 模型使 mIoU 提升 0.5%,有效缓解了局部注意力计算中的误匹配问题。
- 缩放余弦机制增强了注意力对相关支持特征的关注,如注意力得分图可视化所示,从而提升了特征利用效率。
- SCCA 的最优图像块大小为 8,在 PASCAL-5i 和 COCO-20i 上均实现了最高的 mIoU;8 个 SCCA 模块在 mIoU 和 FB-IoU 指标上表现最佳。
- 模型在推理阶段仅需 480.9 GFLOPs(单个查询-支持对),展现出良好的实际可行性与高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。