Skip to main content
QUICK REVIEW

[论文解读] Assessing out-of-domain generalization for robust building damage detection

Vitus Benson, Alexander Ecker|arXiv (Cornell University)|Nov 20, 2020
Infrastructure Maintenance and Monitoring参考文献 24被引用 15
一句话总结

本文通过卫星影像评估了在建筑损毁检测任务中分布外(OOD)泛化性能,揭示了当前最先进模型在未见过的灾害上测试时性能显著下降。研究发现,分布内(IID)性能无法准确预测真实世界中的OOD性能,并表明多领域自适应批量归一化(multi-domain adaptive batch normalization)和随机权重平均(stochastic weight averaging)等技术可提升模型鲁棒性。

ABSTRACT

An important step for limiting the negative impact of natural disasters is rapid damage assessment after a disaster occurred. For instance, building damage detection can be automated by applying computer vision techniques to satellite imagery. Such models operate in a multi-domain setting: every disaster is inherently different (new geolocation, unique circumstances), and models must be robust to a shift in distribution between disaster imagery available for training and the images of the new event. Accordingly, estimating real-world performance requires an out-of-domain (OOD) test set. However, building damage detection models have so far been evaluated mostly in the simpler yet unrealistic in-distribution (IID) test setting. Here we argue that future work should focus on the OOD regime instead. We assess OOD performance of two competitive damage detection models and find that existing state-of-the-art models show a substantial generalization gap: their performance drops when evaluated OOD on new disasters not used during training. Moreover, IID performance is not predictive of OOD performance, rendering current benchmarks uninformative about real-world performance. Code and model weights are available at https://github.com/ecker-lab/robust-bdd.

研究动机与目标

  • 评估建筑损毁检测模型在分布外(OOD)分布偏移下的实际鲁棒性。
  • 挑战对分布内(IID)测试集的依赖,因为其在真实灾害场景中会高估模型性能。
  • 设计并验证一个新的OOD测试基准(OOD-xBD),使用训练过程中未见过的灾害数据。
  • 探究既有的鲁棒性技术(如多领域AdaBN和SWA)是否能提升OOD泛化能力。
  • 证明当前SOTA模型在未见过的灾害上表现出显著的性能下降,从而削弱其实际可部署性。

提出的方法

  • 通过在灾害类别上划分xBD数据集,构建了无重叠的OOD测试集(OOD-xBD),确保训练与测试灾害无交集。
  • 使用xView2分数在IID和OOD测试集上评估了两种最先进模型——双流ResNet50和Dual-HRNet。
  • 应用多领域自适应批量归一化(AdaBN)以通过学习领域不变的批量统计量来提升领域泛化能力。
  • 采用随机权重平均(SWA)通过在多个训练周期上平均权重来增强模型泛化能力。
  • 在多个OOD测试划分上比较模型性能,并评估在原始Gupta & Shah(2020)OOD集和新OOD-xBD集上鲁棒性技术带来的性能增益。
  • 报告平均xView2分数及标准差,并计算泛化差距(IID减去OOD)以量化性能下降。

实验结果

研究问题

  • RQ1当在训练过程中未见过的分布外灾害上评估时,最先进建筑损毁检测模型的表现如何?
  • RQ2分布内(IID)性能在多大程度上与分布外(OOD)性能相关?
  • RQ3既有的鲁棒性技术(如多领域AdaBN和随机权重平均SWA)能否提升OOD泛化能力?
  • RQ4观察到的泛化差距是数据划分带来的伪影,还是反映了当前模型的根本性局限?
  • RQ5一个更真实的OOD基准(OOD-xBD)能否为真实世界灾害场景中的模型鲁棒性提供可靠评估?

主要发现

  • 双流ResNet50在IID数据上的xView2得分为0.74,但在OOD-xBD上下降至0.60,表明泛化差距为0.14。
  • Dual-HRNet的泛化差距较小,为0.06,IID得分为0.73,OOD-xBD得分为0.67,但仍未能在未见灾害上表现良好。
  • IID性能无法预测OOD性能,因为具有相似IID得分的模型在OOD上的表现差异极大。
  • 多领域AdaBN与SWA结合使用,使双流ResNet50在OOD-xBD集上的OOD得分从0.59提升至0.65,将泛化差距缩小至0.07。
  • 多领域AdaBN单独使用时,对Dual-HRNet模型的OOD泛化提升最大,在OOD-xBD上实现了最小的整体泛化差距0.04。
  • 结果证实,鲁棒性技术能显著改善OOD泛化,但仍有显著差距存在,凸显了在建筑损毁检测(BDD)中发展更优领域泛化方法的迫切需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。