[论文解读] A Relation-Augmented Fully Convolutional Network for Semantic Segmentation in Aerial Scenes
本文提出了一种关系增强全卷积网络(RA-FCN),通过两种即插即用模块——空间关系模块与通道关系模块,显式建模特征图中的长程空间关系与通道间关系,从而提升航拍图像语义分割性能。该方法在Vaihiken数据集上取得了88.54%的平均F1分数与89.23%的整体准确率,显著优于FCN-dCRF与SCNN等基线模型。
Most current semantic segmentation approaches fall back on deep convolutional neural networks (CNNs). However, their use of convolution operations with local receptive fields causes failures in modeling contextual spatial relations. Prior works have sought to address this issue by using graphical models or spatial propagation modules in networks. But such models often fail to capture long-range spatial relationships between entities, which leads to spatially fragmented predictions. Moreover, recent works have demonstrated that channel-wise information also acts a pivotal part in CNNs. In this work, we introduce two simple yet effective network units, the spatial relation module and the channel relation module, to learn and reason about global relationships between any two spatial positions or feature maps, and then produce relation-augmented feature representations. The spatial and channel relation modules are general and extensible, and can be used in a plug-and-play fashion with the existing fully convolutional network (FCN) framework. We evaluate relation module-equipped networks on semantic segmentation tasks using two aerial image datasets, which fundamentally depend on long-range spatial relational reasoning. The networks achieve very competitive results, bringing significant improvements over baselines.
研究动机与目标
- 解决CNN在航拍图像语义分割中难以建模长程空间与通道间关系的局限性。
- 通过显式学习空间位置与特征图之间的全局上下文关系,改进全卷积网络的特征表示能力。
- 开发可泛化的即插即用模块,增强现有FCN框架,而无需对网络架构进行大规模修改。
- 验证空间与通道关系模块在解决航拍场景中常见视觉模糊性问题上的有效性。
- 通过消融实验与对比研究,证明在基准航拍数据集上性能的优越性。
提出的方法
- 引入一种空间关系模块,通过类似查询-键-值注意力的操作,建模特征图中任意两个空间位置之间的全局关系。
- 提出一种通道关系模块,捕捉通道维度上不同特征图之间的相互依赖关系,增强通道层面的表示能力。
- 采用关系增强的特征融合机制,将关系感知的特征与原始特征进行拼接或相加,以提升分割性能。
- 支持空间与通道关系模块的串行与并行集成方式,以探索最优的特征增强策略。
- 采用可学习、可微的机制计算所有空间位置对或特征图对之间的关系,支持端到端训练。
- 以即插即用方式将模块应用于现有FCN主干网络(如ResNet)之上,无需修改核心网络架构。
实验结果
研究问题
- RQ1显式建模长程空间关系是否能提升在视觉模糊性较高的航拍场景中的语义分割准确率?
- RQ2通道间关系在语义分割网络中如何促进特征表示的改进?
- RQ3空间与通道关系模块的最佳集成方式是串行还是并行,以实现最大性能增益?
- RQ4关系模块在复杂航拍场景中,能在多大程度上减少空间碎片化并提升预测一致性?
- RQ5所提出的模块是否具备跨不同航拍数据集的泛化能力,并优于依赖局部感受野或CRF的现有方法?
主要发现
- 在Vaihingen数据集上,RA-FCN实现了88.54%的平均F1分数与89.23%的整体准确率,相较于FCN-dCRF与SCNN,平均F1分数分别提升4.98%与3.69%。
- 仅使用空间关系模块时,在Potsdam数据集上,平均F1分数相较于FCN-dCRF提升2.25%,相较于SCNN提升2.67%。
- 串行集成空间与通道关系模块后,相较于基线FCN,平均F1分数提升1.39%,平均IoU提升1.54%。
- RA-FCN显著提升了对分散或视觉模糊目标(如汽车)的识别能力,体现出其在长程推理方面的优势。
- 定性结果表明,RA-FCN减少了不透水表面的误分类,并有效消除了建筑分割中的异常点,尤其在模糊区域表现更优。
- 消融实验表明,两种关系模块均学习到了有意义的全局关系,其中空间模块在利用远距离上下文解决局部模糊性方面尤为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。