[论文解读] GETAM: Gradient-weighted Element-wise Transformer Attention Map for Weakly-supervised Semantic segmentation
该论文提出GETAM,首个基于Transformer的弱监督语义分割框架,利用梯度加权逐元素注意力图生成精确、类别特定的激活图,克服了传统CAMs存在的部分激活和形状失真问题。通过整合一种新颖的双反向传播机制与基于显著图的激活感知标签补全方法,GETAM在PASCAL VOC和MS-COCO数据集上实现了最先进性能,采用单阶段训练流程,优于端到端及多阶段方法。
Weakly Supervised Semantic Segmentation (WSSS) is challenging, particularly when image-level labels are used to supervise pixel level prediction. To bridge their gap, a Class Activation Map (CAM) is usually generated to provide pixel level pseudo labels. CAMs in Convolutional Neural Networks suffer from partial activation ie, only the most discriminative regions are activated. Transformer based methods, on the other hand, are highly effective at exploring global context with long range dependency modeling, potentially alleviating the "partial activation" issue. In this paper, we propose the first transformer based WSSS approach, and introduce the Gradient weighted Element wise Transformer Attention Map (GETAM). GETAM shows fine scale activation for all feature map elements, revealing different parts of the object across transformer layers. Further, we propose an activation aware label completion module to generate high quality pseudo labels. Finally, we incorporate our methods into an end to end framework for WSSS using double backward propagation. Extensive experiments on PASCAL VOC and COCO demonstrate that our results beat the state-of-the-art end-to-end approaches by a significant margin, and outperform most multi-stage methods.m most multi-stage methods.
研究动机与目标
- 为解决弱监督语义分割中类别激活图(CAMs)的局限性,特别是部分激活与形状定位不佳的问题。
- 通过利用视觉Transformer的全局上下文建模能力与长距离依赖特性,探索其在WSSS中的潜力。
- 开发一种新型注意力可视化方法,以捕捉Transformer各层中细粒度、类别特定的对象激活。
- 利用基于显著图的激活感知标签补全方法,生成高质量的伪分割标签。
- 通过双反向传播机制实现WSSS的端到端训练,相比多阶段方法简化了训练流程。
提出的方法
- 提出梯度加权逐元素Transformer注意力图(GETAM),通过将分类头梯度的平方加权于查询与键矩阵的点积,计算逐元素注意力图。
- 在多个Transformer层之间聚合注意力图,逐步揭示不同物体部位,提升空间一致性和形状准确性。
- 引入一种激活感知标签补全模块,将GETAM输出与现成的显著图融合,以优化前景掩码并发现背景物体。
- 采用双反向传播机制,同时反向传播通过分割头与注意力图生成过程,实现端到端训练。
- 使用ViT-Hybrid主干网络,以利用视觉Transformer的全局感受野与自注意力机制,提升特征表示能力。
- 使用图像级标签与通过所提模块生成的伪标签,对整个框架进行端到端训练,避免了多阶段训练流程。
实验结果
研究问题
- RQ1视觉Transformer在弱监督语义分割中是否能产生比CNN更准确、更完整的对象激活图?
- RQ2如何有效将梯度信息整合到自注意力图中,以提升定位精度并减少噪声?
- RQ3能否通过融合多个Transformer层的注意力图,揭示物体的不同部分并改善形状重建?
- RQ4基于显著图的激活感知标签补全能否生成比标准CAM方法更高质量的伪标签?
- RQ5是否可能基于视觉Transformer,通过单阶段、端到端训练框架实现WSSS的SOTA性能?
主要发现
- 在PASCAL VOC 2012验证集上,GETAM达到71.7%的mIoU,在测试集上达到72.3%,较之前SOTA方法AALR提升7.8个百分点。
- 在MS-COCO数据集上,GETAM达到36.4%的mIoU,成为首个在该基准上报告结果且性能具有竞争力的端到端WSSS方法。
- 尽管采用更简单的单阶段流程,GETAM在PASCAL VOC上仍超越多阶段方法如URN与RIB,展现出其高效性与有效性。
- 该方法在不同视觉Transformer主干网络(ViT、DeiT、DeiT-Distilled)上均实现SOTA性能,表明其对网络架构选择具有鲁棒性。
- 双反向传播机制实现了高效的端到端训练,消除了以往SOTA方法所依赖的复杂多阶段流程。
- 可视化结果表明,与传统CAMs相比,GETAM生成的注意力图具有更均匀的激活分布,形状保持性更好,而CAMs通常存在过度平滑且聚焦于判别性区域的问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。