[论文解读] Spatial Attention Pyramid Network for Unsupervised Domain Adaptation
本文提出了一种空间注意力金字塔网络(SAPNet),用于目标检测、实例分割和语义分割中的无监督域自适应。通过采用任务引导的空间注意力机制整合多尺度特征图,SAPNet增强了跨域的判别性特征学习,在Cityscapes→FoggyCityscapes上实现了3%的mAP提升,并在GTA5→Cityscapes上取得了优异结果,性能达到当前最先进水平。
Unsupervised domain adaptation is critical in various computer vision tasks, such as object detection, instance segmentation, and semantic segmentation, which aims to alleviate performance degradation caused by domain-shift. Most of previous methods rely on a single-mode distribution of source and target domains to align them with adversarial learning, leading to inferior results in various scenarios. To that end, in this paper, we design a new spatial attention pyramid network for unsupervised domain adaptation. Specifically, we first build the spatial pyramid representation to capture context information of objects at different scales. Guided by the task-specific information, we combine the dense global structure representation and local texture patterns at each spatial location effectively using the spatial attention mechanism. In this way, the network is enforced to focus on the discriminative regions with context information for domain adaption. We conduct extensive experiments on various challenging datasets for unsupervised domain adaptation on object detection, instance segmentation, and semantic segmentation, which demonstrates that our method performs favorably against the state-of-the-art methods by a large margin. Our source code is available at https://isrc.iscas.ac.cn/gitlab/research/domain-adaption.
研究动机与目标
- 为解决计算机视觉任务(如目标检测与分割)中的域偏移问题,其中源域与目标域存在显著的分布差异。
- 克服先前方法依赖全局分布对齐或未能充分利用多尺度上下文与判别性区域的局限性。
- 设计一种统一框架,通过注意力机制有效融合全局上下文与局部纹理模式,以实现更好的域泛化能力。
- 提升在具有挑战性的域自适应基准测试(如Cityscapes→FoggyCityscapes、PASCAL VOC→Clipart和GTA5→Cityscapes)上的性能。
提出的方法
- 利用多尺度特征图构建空间金字塔表示,以捕捉全局图像级与局部区域级语义信息。
- 引入任务特定的引导空间注意力机制,根据判别性区域的相关性自适应地融合多尺度特征。
- 在空间金字塔中使用平均池化,以保留局部纹理模式并增强对抗性域对齐的特征判别性。
- 应用通道注意力,动态加权多级特征,提升在分布差异较大的域之间的表征学习能力。
- 将空间注意力金字塔集成到深度网络中,并结合对抗性训练,以对齐源域与目标域的特征。
- 利用梯度反转与多损失优化,细化域不变表征,同时保留任务特定的语义信息。
实验结果
研究问题
- RQ1具有多尺度特征的空间金字塔是否能提升目标检测与分割任务中的域自适应性能?
- RQ2任务特定的引导机制如何在无监督域自适应过程中增强注意力对判别性区域的聚焦能力?
- RQ3空间金字塔的深度以及池化策略(平均池化与最大池化)对特征表示质量有何影响?
- RQ4在高度不同的域之间进行域自适应时,通道注意力是否能提升性能?
- RQ5所提出的方法是否能在多样化的域偏移场景(包括风格迁移与天气变化)中实现良好泛化?
主要发现
- 在Cityscapes→FoggyCityscapes目标检测基准上,SAPNet实现了3%的mAP提升,显著优于先前的最先进方法。
- 在GTA5→Cityscapes语义分割任务中,SAPNet取得了具有竞争力的准确率,展现出在域偏移场景下的强大泛化能力。
- 消融实验表明,若移除空间注意力金字塔,PASCAL VOC→Clipart这一最具挑战性的基准上的mAP将下降超过6%。
- 任务特定的引导机制使PASCAL VOC→Clipart上的mAP提升了5.1%,凸显其在聚焦判别性区域方面的重要作用。
- 在空间金字塔中使用平均池化相比最大池化表现更优,在PASCAL VOC→Clipart上实现了4.7%的mAP提升。
- 通道注意力在差异较大的域(如PASCAL VOC→Clipart)中带来1.6%的mAP增益,但在相似域中提升微乎其微,表明其在复杂自适应场景中的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。