[论文解读] Floods Detection in Twitter Text and Images
本文提出一种多模态方法,通过结合文本和视觉特征,用于检测意大利语推文中的洪水相关事件。该方法采用 BERT、词袋模型(BoW)以及预训练卷积神经网络(DenseNet、VGG、ResNet)进行特征提取,通过晚期融合策略融合得分,在开发集上实现了 0.80 的 F1 分数,证明了多模态融合优于单模态方法。
In this paper, we present our methods for the MediaEval 2020 Flood Related Multimedia task, which aims to analyze and combine textual and visual content from social media for the detection of real-world flooding events. The task mainly focuses on identifying floods related tweets relevant to a specific area. We propose several schemes to address the challenge. For text-based flood events detection, we use three different methods, relying on Bog of Words (BOW) and an Italian Version of Bert individually and in combination, achieving an F1-score of 0.77%, 0.68%, and 0.70% on the development set, respectively. For the visual analysis, we rely on features extracted via multiple state-of-the-art deep models pre-trained on ImageNet. The extracted features are then used to train multiple individual classifiers whose scores are then combined in a late fusion manner achieving an F1-score of 0.75%. For our mandatory multi-modal run, we combine the classification scores obtained with the best textual and visual schemes in a late fusion manner. Overall, better results are obtained with the multimodal scheme achieving an F1-score of 0.80% on the development set.
研究动机与目标
- 开发一种多模态系统,利用文本和视觉内容检测意大利语推文中的真实世界洪水事件。
- 评估单模态方法(仅文本和仅图像)与多模态融合在洪水检测中的有效性。
- 通过 SMOTE 对文本和视觉数据中的类别不平衡问题进行处理,实现合成数据增强。
- 比较传统 BoW 与基于深度学习的 BERT 在意大利语文本表征中用于洪水检测的性能。
- 探索通过融合多个模型得分的晚期融合策略,以提升分类性能。
提出的方法
- 使用词袋模型(BoW)和微调后的意大利语 BERT 提取文本特征,分别训练朴素贝叶斯和逻辑回归分类器。
- 使用三个在 ImageNet 上预训练的卷积神经网络(DenseNet、VGG-19、ResNet)提取视觉特征,并在这些特征上训练支持向量机(SVM)分类器。
- 通过 SMOTE 对类别不平衡进行缓解,将少数类(洪水)样本数量增加三倍以实现数据集平衡。
- 晚期融合通过平均各模型的后验概率实现,多模态运行中为所有模型分配相等权重。
- 最终的多模态系统通过晚期融合策略结合表现最佳的文本和图像模型,以提升检测准确率。
- 所有模型均在包含关联图像的意大利语推文数据集上进行训练和评估,聚焦于特定意大利地区的洪水相关性。
实验结果
研究问题
- RQ1与单模态方法相比,结合意大利语推文中的文本和视觉特征是否能提升洪水检测性能?
- RQ2意大利语 BERT 模型在分类意大利语洪水相关推文方面,与传统 BoW 方法相比效果如何?
- RQ3对多个基于视觉特征训练的深度学习模型进行晚期融合,是否优于单个模型在洪水检测中的表现?
- RQ4数据不平衡在多大程度上影响模型性能?SMOTE 是否能有效缓解文本和图像分类中的该问题?
- RQ5在等权重设置下,多模态晚期融合是否能持续提升 F1 分数,超过最佳单模态基线?
主要发现
- 多模态晚期融合方法在开发集上取得了最高的 F1 分数 0.80,优于所有单模态方法。
- 基于 BoW 的文本模型在所有文本方法中表现最佳,其在开发集上的 F1 分数为 0.77。
- 仅视觉模型在开发集上取得了 0.75 的 F1 分数,表明深度 CNN 特征具有较强的表征能力。
- 在晚期融合中联合使用 BoW 和 BERT 导致 F1 分数略微下降至 0.70,低于仅使用 BoW 的情况,表明在此情境下 BERT 并未提升性能。
- 所有运行在测试集上的表现显著偏低,多模态运行仅达到 0.093 的 F1 分数,表明可能存在分布偏移或测试集难度较高。
- 所有团队的平均 F1 分数低于 20%,凸显了该测试集在洪水检测任务中的高度复杂性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。