Skip to main content
QUICK REVIEW

[论文解读] Revisiting Classical Bagging with Modern Transfer Learning for On-the-fly Disaster Damage Detector

Junghoon Seo, Seungwon Lee|arXiv (Cornell University)|Oct 4, 2019
Infrastructure Maintenance and Monitoring参考文献 24被引用 5
一句话总结

该论文提出了一种简单而有效的方法,将经典的袋装法(bagging)与现代迁移学习相结合,以解决在仅使用极少标注数据的情况下,实时灾后损毁检测中的极端类别不平衡问题。通过利用ImageNet预训练的ResNet34模型,并对大量未受损(负样本)数据的多个自助抽样子集进行集成平均,该方法在性能上达到当前最先进水平,在正样本为5-shot的设定下,误差率相比先前方法最高降低53.3%。

ABSTRACT

Automatic post-disaster damage detection using aerial imagery is crucial for quick assessment of damage caused by disaster and development of a recovery plan. The main problem preventing us from creating an applicable model in practice is that damaged (positive) examples we are trying to detect are much harder to obtain than undamaged (negative) examples, especially in short time. In this paper, we revisit the classical bootstrap aggregating approach in the context of modern transfer learning for data-efficient disaster damage detection. Unlike previous classical ensemble learning articles, our work points out the effectiveness of simple bagging in deep transfer learning that has been underestimated in the context of imbalanced classification. Benchmark results on the AIST Building Change Detection dataset show that our approach significantly outperforms existing methodologies, including the recently proposed disentanglement learning.

研究动机与目标

  • 为解决灾后损毁检测中极端类别不平衡的挑战,即正样本(受损)稀少且灾后难以立即获取。
  • 克服现有欠采样方案在微调过程中降低模型监督信号并增加方差的局限性。
  • 证明经典袋装法若与现代迁移学习结合,可在少样本、类别极度不平衡的分类设置中显著提升性能。
  • 建立一种实用的实时损毁检测框架,仅需极少预存数据集,灾后可快速部署。

提出的方法

  • 采用ImageNet预训练的ResNet34作为基础模型,以利用强大的特征表示,提升低数据场景下的泛化能力。
  • 通过从丰富的负样本(未受损)中进行有放回的随机抽样,应用经典的自助聚合(bagging)方法构建多个训练子集。
  • 集成中的每个基础模型均在不同的负样本自助抽样子集上进行微调,而所有模型均使用相同的少量正样本。
  • 最终预测通过平均所有集成成员的Softmax概率获得,从而增强鲁棒性并降低方差。
  • 该方法避免使用数据增强或复杂的结构修改,转而专注于最大化数据利用率和模型校准。
  • 通过调整集成规模(1至20)研究性能增益与计算成本之间的权衡,发现在10–15个模型以上时增益逐渐减少。

实验结果

研究问题

  • RQ1当经典袋装法与现代迁移学习结合时,是否能有效缓解灾后损毁检测中常见极端类别不平衡场景下的性能退化?
  • RQ2与标准欠采样或从零开始训练相比,使用自助抽样子集的集成学习是否能提升模型准确率并降低方差?
  • RQ3在仅含少量正样本的少样本设置下,从ImageNet预训练权重进行迁移学习如何影响模型性能与校准?
  • RQ4在该类别不平衡学习设置中,平衡性能增益与计算成本的最优集成规模是多少?

主要发现

  • 所提出的基于袋装法的集成方法结合迁移学习,在正样本为5-shot的设定下,相比之前最先进模型,误差率降低53.3%。
  • 在正样本为50-shot的设定下,该方法仍实现了27.8%的误差率改善,表明在不同样本设置下均具有一致优势。
  • 使用ImageNet预训练模型使性能方差相比从零开始训练最多减少一半,尤其在低样本场景下效果显著。
  • 集成带来的性能增益在预训练模型上最为显著,在5-shot情况下,当基础模型数量从1增加到5时,误差率降低39.6%。
  • 即使仅有5个正样本,该方法仍实现了比现有基准更高的平均准确率和更低的方差,因此非常适用于实时的在线部署。
  • 迁移学习与集成的优势在低样本设置下更为突出,当集成成员超过10–15个后,增益逐渐减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。