[论文解读] Semantic Segmentation with Reverse Attention
本文提出逆注意网络(RAN),一种三分支全卷积网络,通过显式学习正样本(目标类别)和负样本(非目标类别)特征,实现反向学习,从而提升语义分割性能。通过引入一种增强模糊区域响应的逆注意机制,RAN 在 PASCAL-Context 数据集上达到 48.1% 的平均 IoU,且在 PASCAL VOC、NYUDv2、Person-Part 和 ADE20K 等数据集上均实现一致的性能提升。
Recent development in fully convolutional neural network enables efficient end-to-end learning of semantic segmentation. Traditionally, the convolutional classifiers are taught to learn the representative semantic features of labeled semantic objects. In this work, we propose a reverse attention network (RAN) architecture that trains the network to capture the opposite concept (i.e., what are not associated with a target class) as well. The RAN is a three-branch network that performs the direct, reverse and reverse-attention learning processes simultaneously. Extensive experiments are conducted to show the effectiveness of the RAN in semantic segmentation. Being built upon the DeepLabv2-LargeFOV, the RAN achieves the state-of-the-art mIoU score (48.1%) for the challenging PASCAL-Context dataset. Significant performance improvements are also observed for the PASCAL-VOC, Person-Part, NYUDv2 and ADE20K datasets.
研究动机与目标
- 为解决现有语义分割网络仅关注学习与目标类别相关的特征,导致边界区域混淆的问题。
- 提升在重叠或视觉模式相似导致响应微弱的复杂区域中的分割精度。
- 通过学习‘相反’概念,显式教导网络区分目标类与非目标类。
- 通过一种新颖的逆注意机制,增强模糊空间区域的特征区分能力。
- 基于改进的 DeepLabv2-LargeFOV 主干网络,在多个基准数据集上实现最先进性能。
提出的方法
- RAN 架构由三个并行分支组成:直接分支用于目标类的标准分割,反向分支用于学习与目标类无关的特征,反向注意分支则应用可学习的注意掩码,以增强模糊区域的弱响应。
- 反向注意分支使用经过 Sigmoid 激活的掩码,聚焦于置信度低或模糊性高的局部区域,从而提升响应差异性。
- 网络通过在所有三个分支上使用交叉熵损失进行端到端训练,所有分支的特征图融合后生成最终预测结果。
- 该方法基于 DeepLabv2-LargeFOV 与 ResNet-101 构建,利用空洞卷积和多尺度上下文聚合机制。
- 为每类生成一个类别特定的反向注意掩码,以选择性增强目标物体在视觉上与背景或其他物体相似的区域响应。
- 最终的分割输出通过融合所有三个分支的预测结果获得,结合正负知识以提升定位精度。
实验结果
研究问题
- RQ1学习目标类的‘相反’概念是否能提升在模糊或边界区域的语义分割性能?
- RQ2是否专用的反向注意机制能通过增强混淆空间模式中的弱响应,带来更高的分割精度?
- RQ3显式建模非目标特征是否能减少相似类别之间或物体与背景之间的混淆?
- RQ4将反向学习与标准语义学习相结合,是否能在多样化数据集上带来一致的性能增益?
- RQ5RAN 架构是否能在 PASCAL-Context、PASCAL VOC、NYUDv2 和 ADE20K 等挑战性基准上实现最先进性能?
主要发现
- 在 PASCAL-Context 数据集上,RAN 达到 48.1% 的最先进平均 IoU,显著优于基线模型 DeepLabv2-LargeFOV。
- 在 PASCAL VOC2012 数据集上,RAN 相较于基线模型提升 1.4% 的平均 IoU,最终得分分别为 RAN-s 的 80.5% 和 RAN-n 的 80.4%。
- 在 NYUDv2 数据集上,RAN 相较于基线模型 DeepLabv2-LargeFOV 提升约 3.9 个百分点,达到 RAN-s 的 41.2% 和 RAN-n 的 40.7% 的平均 IoU。
- 在 ADE20K 数据集上,RAN 达到 35.2%(RAN-s)和 35.3%(RAN-n)的平均 IoU,相较基线模型 DeepLabv2-LargeFOV 提升约 2%。
- 在 NYUDv2 上的定性结果表明,RAN 生成了更清晰、更精确的预测,尤其在重叠物体复杂的室内场景中表现更优。
- 消融实验确认,反向注意机制对性能提升有显著贡献,尤其在低置信度响应区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。