Skip to main content
QUICK REVIEW

[论文解读] Multi-Modal Machine Learning for Flood Detection in News, Social Media and Satellite Sequences

Kashif Ahmad, Konstantin Pogorelov|arXiv (Cornell University)|Oct 7, 2019
Anomaly Detection Techniques and Applications参考文献 11被引用 4
一句话总结

本论文在 MediaEval 2019 挑战赛中提出了一种用于新闻、社交媒体和卫星图像的多模态机器学习框架,以实现洪水检测。该框架结合了预训练卷积神经网络(AlexNet、VGG、ResNet)的深度特征与颜色及场景级特征,采用早期融合与晚期融合策略,在新闻图像主题消歧任务中取得 82.63 的 F1 分数,在基于卫星图像的洪水检测任务中取得 58.82 的 F1 分数。

ABSTRACT

In this paper we present our methods for the MediaEval 2019 Mul-timedia Satellite Task, which is aiming to extract complementaryinformation associated with adverse events from Social Media andsatellites. For the first challenge, we propose a framework jointly uti-lizing colour, object and scene-level information to predict whetherthe topic of an article containing an image is a flood event or not.Visual features are combined using early and late fusion techniquesachieving an average F1-score of82.63,82.40,81.40and76.77. Forthe multi-modal flood level estimation, we rely on both visualand textual information achieving an average F1-score of58.48and46.03, respectively. Finally, for the flooding detection in time-based satellite image sequences we used a combination of classicalcomputer-vision and machine learning approaches achieving anaverage F1-score of58.82%

研究动机与目标

  • 开发一种多模态系统,利用新闻文章、社交媒体帖子和卫星图像序列等多种数据源检测洪水事件。
  • 通过视觉和文本特征,高精度地分类新闻图像中的洪水相关内容。
  • 通过检测人员是否站立在膝盖以上水中的方式,估计社交媒体图像中的洪水水位。
  • 采用混合计算机视觉与机器学习方法,检测时间序列卫星图像中的洪水事件。
  • 克服卫星序列中云层覆盖、季节性变化和图像错位等数据限制问题。

提出的方法

  • 在 ImageNet 和 Places 数据集上,使用预训练的卷积神经网络(AlexNet、VGG、ResNet)提取深度视觉特征,以实现对物体和场景的理解。
  • 通过早期融合(特征向量拼接)和晚期融合(简单平均及基于粒子群优化的加权平均)结合特征,以提升分类性能。
  • 利用 LIRE 库通过联合复合描述符(JCD)集成颜色与纹理特征,实现全局图像表征。
  • 针对洪水水位估计,采用两阶段视觉方法:首先使用深度特征分类洪水与非洪水图像,然后利用 OpenPose 检测人体关键点,以评估水位相对于膝盖高度的位置。
  • 针对文本分析,应用词袋模型(BoW)和长短期记忆网络(LSTM)模型,基于洪水相关内容对文章进行分类。
  • 针对卫星图像序列,应用多阶段图像处理流水线:通过阈值法进行云层遮罩,将图像重采样至 128×128,转换至 HSV 颜色空间,对 S/V 通道进行遮罩,应用形态学滤波,并利用灰度共生矩阵(GLCM)进行纹理分析,最后通过随机森林分类。

实验结果

研究问题

  • RQ1早期与晚期融合多尺度视觉特征(颜色、物体、场景)是否能提升新闻图像中洪水检测的准确性?
  • RQ2视觉特征与文本特征在社交媒体内容洪水水位估计中,其互补性在多大程度上得以体现?
  • RQ3在存在云层覆盖和图像错位的卫星图像序列中,经典图像处理流水线(含形态学滤波与纹理分析)在检测洪水方面的有效性如何?
  • RQ4基于粒子群优化的晚期融合是否优于等权重融合或早期融合策略,在多模态洪水检测中表现更优?
  • RQ5通过 OpenPose 检测人体关键点,是否能可靠判断图像中人员是否站立在膝盖以上水中?

主要发现

  • 基于粒子群优化的晚期融合方法在 NITD 任务中取得最高 F1 分数 82.63,优于等权重融合(82.40)和早期融合(76.77)。
  • 引入基于 JCD 的颜色特征并未提升性能,反而轻微降低结果,包含颜色特征的实验中 F1 分数下降至 81.40。
  • 基于视觉的洪水水位估计取得 F1 分数 58.48,显著优于使用 BoW 和 LSTM 模型的文本方法(46.03)。
  • 基于卫星的洪水检测系统在 CSS 任务中取得 F1 分数 58.82,尽管面临云层覆盖和图像错位等挑战,仍表现出有效性。
  • 系统难以区分洪水引起的视觉变化与季节性植被生长,表明在视觉变化相似的情况下泛化能力存在局限。
  • 通过重采样数据集的集成学习方法提升了在类别不平衡数据上的性能,尤其对稀有类别(洪水相关图像)有显著改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。