Skip to main content
QUICK REVIEW

[论文解读] Fully convolutional Siamese neural networks for buildings damage assessment from satellite images

Eugene Khvedchenya, Tatiana Gabruseva|arXiv (Cornell University)|Oct 31, 2021
Remote-Sensing Image Classification被引用 7
一句话总结

本文提出了一种具有编码器-解码器架构的全卷积孪生神经网络,用于利用灾前和灾后卫星图像实现建筑物损伤的自动化评估。通过利用成对图像的特征级拼接以及加权交叉熵损失,该模型在xView2挑战赛中取得了最先进性能,加权F1分数达到0.7776,优于标准方法和消融变体。

ABSTRACT

Damage assessment after natural disasters is needed to distribute aid and forces to recovery from damage dealt optimally. This process involves acquiring satellite imagery for the region of interest, localization of buildings, and classification of the amount of damage caused by nature or urban factors to buildings. In case of natural disasters, this means processing many square kilometers of the area to judge whether a particular building had suffered from the damaging factors. In this work, we develop a computational approach for an automated comparison of the same region's satellite images before and after the disaster, and classify different levels of damage in buildings. Our solution is based on Siamese neural networks with encoder-decoder architecture. We include an extensive ablation study and compare different encoders, decoders, loss functions, augmentations, and several methods to combine two images. The solution achieved one of the best results in the Computer Vision for Building Damage Assessment competition.

研究动机与目标

  • 解决自然灾害后快速、自动化进行建筑物损伤评估的迫切需求,以支持人道主义救援行动。
  • 开发一种深度学习模型,通过灾前和灾后图像对,同时实现建筑物定位和损伤等级分类。
  • 通过有效的损失加权和数据增强,克服损伤标注中的类别不平衡问题,即大多数建筑物未受损。
  • 通过评估多种编码器、解码器、损失函数和图像组合策略,优化模型架构。
  • 通过端到端训练和广泛的消融研究,在xView2计算机视觉建筑物损伤评估挑战赛中实现高性能表现。

提出的方法

  • 采用共享编码器权重的孪生神经网络,从成对的灾前和灾后卫星图像(1024×1024像素)中提取特征。
  • 在解码器之前通过拼接或减法组合两幅图像的特征图,其中拼接方法表现更优。
  • 使用U-Net风格的解码器,重建一个5类语义分割掩码(0:无建筑物,1–4:损伤等级)至全分辨率。
  • 在512×512裁剪图像上进行训练,采用五折交叉验证并结合多标签分层采样,以保持各折中损伤分布的一致性。
  • 应用空间和颜色数据增强技术以提高泛化能力,尤其针对稀有损伤类别。
  • 实施加权交叉熵损失,其中'无建筑物'和'无损伤'类的类别权重为1.0,'轻微'、'严重'和'完全破坏'损伤类别的权重为3.0,以缓解类别不平衡问题。

实验结果

研究问题

  • RQ1具有共享权重的孪生架构与标准的成对图像特征拼接方法相比,在建筑物损伤评估中表现如何?
  • RQ2哪种图像组合方法——特征拼接或相减——在损伤分类和定位任务中表现更优?
  • RQ3哪种预训练编码器架构(如ResNet、DenseNet、EfficientNet)在准确率与计算成本之间提供了最佳平衡?
  • RQ4不同损失函数,尤其是加权交叉熵损失,如何影响模型在类别不平衡损伤分类数据上的性能?
  • RQ5数据增强策略在多大程度上提升了模型的鲁棒性和泛化能力,特别是对代表性不足的损伤类别?

主要发现

  • 采用特征图拼接的孪生架构优于标准图像拼接方法,使用SE-ResNeXt-50编码器和U-Net解码器时,加权F1分数达到0.7776。
  • SE-ResNeXt-50编码器表现最佳(F1loc: 0.8797,F1class: 0.7338,Score: 0.7776),优于ResNet和DenseNet变体。
  • 采用3.0的类别权重对损伤类别的加权交叉熵损失使F1class提升了0.018,显著改善了稀有损伤等级的性能。
  • 空间和颜色增强使F1class相比无增强提升了0.018,但更强的增强策略未带来进一步增益。
  • U-Net解码器始终优于FPN,在所有编码器类型中,加权F1分数提升了0.005–0.015。
  • ResNet-18及其他轻量化编码器表现欠佳,因欠拟合,表明深层架构对于捕捉复杂损伤模式是必要的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。