[论文解读] SAN: Scale-Aware Network for Semantic Segmentation of High-Resolution Aerial Images
本文提出了一种用于高分辨率航拍图像语义分割的尺度感知模块(SAM),通过可学习的二维重采样图自适应地重采样特征图,以处理尺度不一致的物体。该方法在保持极低计算开销和端到端可训练性的前提下,显著提升了小尺寸、大尺寸及长条形建筑物的特征表示能力,在ISPRS Vaihiken数据集上实现了最先进性能。
High-resolution aerial images have a wide range of applications, such as military exploration, and urban planning. Semantic segmentation is a fundamental method extensively used in the analysis of high-resolution aerial images. However, the ground objects in high-resolution aerial images have the characteristics of inconsistent scales, and this feature usually leads to unexpected predictions. To tackle this issue, we propose a novel scale-aware module (SAM). In SAM, we employ the re-sampling method aimed to make pixels adjust their positions to fit the ground objects with different scales, and it implicitly introduces spatial attention by employing a re-sampling map as the weighted map. As a result, the network with the proposed module named scale-aware network (SANet) has a stronger ability to distinguish the ground objects with inconsistent scale. Other than this, our proposed modules can easily embed in most of the existing network to improve their performance. We evaluate our modules on the International Society for Photogrammetry and Remote Sensing Vaihingen Dataset, and the experimental results and comprehensive analysis demonstrate the effectiveness of our proposed module.
研究动机与目标
- 解决高分辨率航拍图像中物体尺度不一致带来的语义分割困难问题。
- 克服深度网络中固定感受野无法有效捕捉小尺寸或大尺寸物体的局限性。
- 开发一种能够适应空间尺度和输入数据特征的模块,以提升泛化能力。
- 实现与现有网络的无缝集成,无需架构重构或显著增加参数量。
- 在遥感基准上证明其性能优于空间注意力机制和多尺度融合基线方法。
提出的方法
- 提出一种可学习2D重采样图的尺度感知模块(SAM),动态调整像素位置以适应物体尺度。
- 通过特征图与重采样图的逐元素相乘,隐式实现空间注意力机制。
- 通过反向传播端到端训练重采样图,实现数据自适应与位置自适应的特征重配置。
- 将SAM集成到全卷积网络(FCN8s)中,构建尺度感知网络(SANet)。
- 利用重采样机制将有效采样空间扩展至标准卷积操作之外。
- 通过保持标准卷积层并仅添加轻量级SAM模块,确保与现有网络的兼容性。
实验结果
研究问题
- RQ1可学习的重采样机制是否能提升高分辨率航拍图像中不同尺度物体的语义分割精度?
- RQ2与传统空间注意力机制相比,所提出的SAM在处理尺度变化时表现如何?
- RQ3与标准FCN相比,SAM在小尺寸、大尺寸及长条形建筑物的特征表示方面提升程度如何?
- RQ4该模块是否能在无需针对特定尺度设计的情况下泛化到不同输入图像?
- RQ5SAM是否能以极低的性能和参数开销有效嵌入到现有网络中?
主要发现
- 与原始FCN8s相比,所提出的SAM在小尺寸、大尺寸及长条形建筑物的分割精度上均有显著提升。
- 在ISPRS Vaihingen数据集上,尽管仅使用IRRG图像且未使用DSM,SANet结合SAM的性能仍优于DeepLabv3+、PSPNet和UNet等基线模型。
- 在参数量相同的情况下,基于SAM的模型mIoU高于空间注意力模块,证明其在尺度感知特征学习方面的优越性。
- 可视化结果表明,SAM在所有物体尺度下均生成更均匀、更完整的激活图,尤其在大尺寸和长条形建筑物上表现更优。
- 该方法在极端情况(如建筑物占据图像大部分区域)下仍保持强性能,而原始FCN8s因感受野受限而失效。
- 消融实验确认性能提升源于尺度感知重采样机制,而非额外参数的简单增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。