[论文解读] SFFNet: A Wavelet-Based Spatial and Frequency Domain Fusion Network for Remote Sensing Segmentation
SFFNet 是一种基于小波的两阶段融合网络,通过整合空间域与频域特征,提升了遥感图像分割性能。它采用基于哈尔小波的频域分解模块(WTFD)进行频率分解,并引入多尺度双表示对齐滤波器(MDAF)以对齐和融合空间与频域特征,最终在 Potsdam 数据集上实现了 87.73% 的 mIoU,达到当前最优性能。
In order to fully utilize spatial information for segmentation and address the challenge of handling areas with significant grayscale variations in remote sensing segmentation, we propose the SFFNet (Spatial and Frequency Domain Fusion Network) framework. This framework employs a two-stage network design: the first stage extracts features using spatial methods to obtain features with sufficient spatial details and semantic information; the second stage maps these features in both spatial and frequency domains. In the frequency domain mapping, we introduce the Wavelet Transform Feature Decomposer (WTFD) structure, which decomposes features into low-frequency and high-frequency components using the Haar wavelet transform and integrates them with spatial features. To bridge the semantic gap between frequency and spatial features, and facilitate significant feature selection to promote the combination of features from different representation domains, we design the Multiscale Dual-Representation Alignment Filter (MDAF). This structure utilizes multiscale convolutions and dual-cross attentions. Comprehensive experimental results demonstrate that, compared to existing methods, SFFNet achieves superior performance in terms of mIoU, reaching 84.80% and 87.73% respectively.The code is located at https://github.com/yysdck/SFFNet.
研究动机与目标
- 为解决在阴影、边缘和纹理区域等存在显著灰度变化区域的遥感图像分割挑战。
- 在引入频域特征的同时,保留空间细节与语义信息,以提升模型鲁棒性。
- 通过有效的特征对齐与选择,弥合空间域与频域表示之间的语义鸿沟。
- 通过融合 Swin Transformer 与多尺度双注意力机制,增强遥感图像分割中的全局建模能力。
- 证明基于小波的频域融合方法相较于纯空间或纯频域方法具有优越性。
提出的方法
- 网络采用两阶段设计:首先,利用引入 Swin Transformer 以增强全局建模能力的主干网络提取空间特征。
- 在第二阶段,通过小波变换特征分解器(WTFD)将空间特征映射至空间域与频域,该模块利用哈尔小波变换将特征分解为低频与高频分量。
- 引入多尺度双表示对齐滤波器(MDAF)以实现跨域特征的对齐与融合:其通过多尺度垂直卷积实现特征扩展,并利用双交叉注意力机制弥合频域与空间特征之间的语义鸿沟。
- MDAF 通过强调来自两个域的相关特征,实现选择性融合,从而提升表征学习能力与特征判别能力。
- 网络采用端到端训练,结合交叉熵损失与 Dice 损失,以优化遥感基准数据集上的分割精度。
- 该架构在 Vaihingen 与 Potsdam 数据集上进行评估,并通过消融实验验证各组件的贡献。
实验结果
研究问题
- RQ1通过小波变换集成频域特征,是否能提升在存在显著灰度变化的遥感图像中的分割精度?
- RQ2如何有效对齐空间与频域特征,以减小语义鸿沟并实现联合表征学习?
- RQ3所提出的 MDAF 机制是否在融合多尺度空间与频域特征方面优于传统注意力或融合模块?
- RQ4将 Swin Transformer 与基于小波的频域分解相结合,能在多大程度上增强遥感图像分割中的全局上下文建模能力?
- RQ5在标准遥感基准数据集上,SFFNet 在 mIoU、F1 分数与 OA 指标上与当前最先进方法相比表现如何?
主要发现
- 在 Vaihingen 数据集上,SFFNet 达到 84.80% 的 mIoU,优于现有方法。
- 在 Potsdam 数据集上,SFFNet 实现 87.73% 的 mIoU、93.36% 的 F1 分数与 91.88% 的 OA,较 ST-Unet 提升 2.27% 的 mIoU,较 XNet 提升 2.22% 的 mIoU。
- 消融实验表明,WTFD 与 MDAF 两个组件均对性能提升有显著贡献,其中 MDAF 在跨域特征对齐中起关键作用。
- 可视化对比显示,SFFNet 有效分割了阴影、边缘与高纹理区域等挑战性区域,且避免了如 XNet 等纯频域方法中常见的空间信息丢失问题。
- SFFNet 在复杂遥感场景分割中展现出更优的鲁棒性与准确性,尤其在存在显著灰度变化的区域表现突出。
- 将哈尔小波变换与深度学习结合,可在不损失空间细节的前提下,提升模型泛化能力与特征判别能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。