[论文解读] Change Detection in Multi-temporal VHR Images Based on Deep Siamese Multi-scale Convolutional Networks
本文提出了一种新颖的深度学习框架,用于在多时相超高清(VHR)图像中进行变化检测,该框架在深度孪生卷积神经网络中引入了多尺度特征卷积单元(MFCU)。该方法采用无监督和有监督两种架构——DSMS-CN 和 DSMS-FCN,通过全连接条件随机场(FC-CRF)进行优化,实现了参数更少、实时推理的最先进性能。
Very-high-resolution (VHR) images can provide abundant ground details and spatial geometric information. Change detection in multi-temporal VHR images plays a significant role in urban expansion and area internal change analysis. Nevertheless, traditional change detection methods can neither take full advantage of spatial context information nor cope with the complex internal heterogeneity of VHR images. In this paper, a powerful feature extraction model entitled multi-scale feature convolution unit (MFCU) is adopted for change detection in multi-temporal VHR images. MFCU can extract multi-scale spatial-spectral features in the same layer. Based on the unit two novel deep siamese convolutional neural networks, called as deep siamese multi-scale convolutional network (DSMS-CN) and deep siamese multi-scale fully convolutional network (DSMS-FCN), are designed for unsupervised and supervised change detection, respectively. For unsupervised change detection, an automatic pre-classification is implemented to obtain reliable training samples, then DSMS-CN fits the statistical distribution of changed and unchanged areas from selected training samples through MFCU modules and deep siamese architecture. For supervised change detection, the end-to-end deep fully convolutional network DSMS-FCN is trained in any size of multi-temporal VHR images, and directly outputs the binary change map. In addition, for the purpose of solving the inaccurate localization problem, the fully connected conditional random field (FC-CRF) is combined with DSMS-FCN to refine the results. The experimental results with challenging data sets confirm that the two proposed architectures perform better than the state-of-the-art methods.
研究动机与目标
- 解决传统变化检测方法在 VHR 图像中的局限性,这些方法未能有效利用空间-光谱上下文信息,且难以应对内部异质性问题。
- 克服低层次特征提取与单尺度卷积单元在捕捉 VHR 图像中多尺度空间-光谱模式方面的不足。
- 开发一种端到端的深度学习框架,实现在多时相 VHR 图像中准确、高效且实时的变化检测。
- 集成 FC-CRF 以优化分割边界,提升基于深度学习的变化检测中的定位精度。
- 通过将 MFCU 模块嵌入多种网络架构中,验证其泛化能力与效率,实现性能提升与模型尺寸减小。
提出的方法
- 提出多尺度特征卷积单元(MFCU),在单层中同时使用 1×1、3×3 和 5×5 卷积核提取多尺度空间-光谱特征,并结合 3×3 最大池化操作。
- 设计一种深度孪生多尺度卷积网络(DSMS-CN),用于无监督变化检测,通过自动预分类样本进行训练,以匹配变化与未变化区域的统计分布。
- 提出一种深度孪生多尺度全卷积网络(DSMS-FCN),用于有监督变化检测,可处理任意尺寸图像,无需基于滑动窗口的分块处理。
- 将全连接条件随机场(FC-CRF)作为后处理模块,利用网络输出作为一元势能,对 DSMS-FCN 生成的二值变化图进行优化。
- 在 ACD 数据集上端到端训练 DSMS-FCN,并在 Szada-1 和 Tisza-3 等多个基准数据集上验证其性能。
- 将现有 FCN 架构中的标准单尺度卷积单元替换为 MFCU,以提升特征表示能力并降低模型复杂度。
实验结果
研究问题
- RQ1多尺度特征卷积单元(MFCU)是否能在单个卷积层内有效捕捉 VHR 图像中多尺度的空间-光谱特征?
- RQ2所提出的深度孪生架构(DSMS-CN)是否在具有挑战性的 VHR 图像数据集中优于现有无监督变化检测方法?
- RQ3端到端的 DSMS-FCN 架构是否能在保持低计算成本和实时推理的前提下,实现更优的有监督变化检测性能?
- RQ4将 FC-CRF 与 DSMS-FCN 集成后,对变化检测结果的定位精度与边界精确度提升程度如何?
- RQ5与传统的单尺度卷积单元及现有最先进模型相比,基于 MFCU 的架构在参数效率与性能方面表现如何?
主要发现
- 在 Tiszadob-3 数据集上,MSFC-EF-FCCRF 的 F1 得分为 0.9638,总体准确率(OA)为 0.9874,Kappa 系数(KC)为 0.9560,优于所有对比方法,包括 DSCN、CXM、SCCN、FC-EF、FC-Siam-Conc 和 FC-Siam-Diff。
- DSMS-FCN 在 ACD 数据集上取得 F1 得分为 0.8690,OA 为 0.9552,尽管 F1 略低于 MSFC-EF,但后者得益于额外的优化步骤,表明其性能具有竞争力。
- MSFC-EF 模型相比 FC-EF 将模型尺寸减少了 14.5%,同时在 Szada-1 和 Tisza-3 数据集上均提升了 OA 和 F1 得分。
- DSMS-FCN 相较于 FC-Siam-Conc 和 FC-Siam-Diff,可训练参数数量分别减少了 46.9% 和 38.4%,同时实现了更优性能。
- DSMS-FCN 的推理时间每张图像低于 0.1 秒,FC-CRF 推理时间每张图像低于 1 秒,支持多时相 VHR 图像的实时处理。
- 将 FC-CRF 与 DSMS-FCN 集成后,F1 得分从 0.8690 提升至 0.8886,OA 从 0.9552 提升至 0.9620,证实其在边界定位优化方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。