Skip to main content
QUICK REVIEW

[论文解读] Deep Learning based Multi-Label Image Classification of Protest Activities

Yingzhou Lu, Kosaku Sato|arXiv (Cornell University)|Jan 10, 2023
Sentiment Analysis and Opinion Mining被引用 6
一句话总结

本文提出了一种基于深度学习的多标签图像分类框架,用于从拉丁美洲社交媒体图像中检测与抗议活动相关的视觉属性(如大规模人群、警察、标志和火焰)。在GSR数据集的手动标注子集上微调卷积神经网络(CNN)后,该模型在七个标签上的平均F1得分为71%,在训练效率和召回率方面优于支持向量机(SVM),但由于类别不平衡和多标签复杂性,精确匹配准确率仍较低(约20%)。

ABSTRACT

With the rise of internet technology amidst increasing rates of urbanization, sharing information has never been easier thanks to globally-adopted platforms for digital communication. The resulting output of massive amounts of user-generated data can be used to enhance our understanding of significant societal issues particularly for urbanizing areas. In order to better analyze protest behavior, we enhanced the GSR dataset and manually labeled all the images. We used deep learning techniques to analyze social media data to detect social unrest through image classification, which performed good in predict multi-attributes, then also used map visualization to display protest behaviors across the country.

研究动机与目标

  • 通过利用图像中的视觉属性,提升对抗议活动的检测能力,超越基于文本的社会媒体分析。
  • 解决传统基于NLP的方法所忽略的关键视觉细节(如人群规模、警察存在或抗议者人口统计特征)的局限性。
  • 开发一种稳健的多标签图像分类系统,能够同时识别多个与抗议相关的属性。
  • 通过自动化、语言无关的用户生成内容图像分析,增强对社会动荡的情境感知能力。
  • 通过深度学习和阈值优化,克服抗议图像数据集中类别不平衡和视觉特征模糊带来的挑战。

提出的方法

  • 通过人工标注GSR(Gold Standard Report)数据集中的9,504张图像,构建了一个多标签数据集,重点关注与抗议相关的属性,如火焰、旗帜、大规模人群、警察、标志、学生以及“其他”。
  • 应用带有迁移学习的深度卷积神经网络(CNN),使用全连接层预测多标签输出,并采用学习到的概率阈值。
  • 利用马修斯相关系数(MCC)优化每个类别的预测阈值,将模型输出的概率转换为二值标签。
  • 采用一对多策略,将CNN性能与传统SVM分类器进行对比,评估指标包括精确率、召回率、F1得分和训练效率。
  • 使用地图可视化技术,基于图像预测结果在拉丁美洲各区域空间呈现检测到的抗议行为。
  • 通过小批量训练等技术缓解数据不平衡和过拟合风险,并探索未来使用生成对抗网络(GANs)进行数据增强的潜力。

实验结果

研究问题

  • RQ1深度学习模型是否能有效检测社交媒体图像中多个与抗议相关的视觉属性,即使这些属性共现或存在模糊性?
  • RQ2与传统SVM相比,基于CNN的多标签分类模型在抗议图像数据上的准确率、召回率和训练效率方面表现如何?
  • RQ3数据集中类别不平衡在多大程度上影响多标签图像分类模型的性能?
  • RQ4与仅依赖文本的监测系统相比,语言无关的图像分析在社会动荡早期检测方面是否具有优势?
  • RQ5当前基于图像的抗议检测模型存在哪些主要局限性?可通过数据增强或多模态融合手段如何缓解?

主要发现

  • CNN模型在所有七个标签上的平均F1得分为71%,在召回率(73% vs. 61%)和训练速度方面均优于SVM。
  • CNN模型在‘火焰’上的精确率为76%,在‘大规模人群’上为74%,在‘标志’上为51%,表明其在高可见度属性上表现强劲。
  • 尽管各类别性能良好,但模型的精确标签匹配准确率仅为约20%,凸显在类别不平衡条件下多标签预测的挑战。
  • CNN所需内存和训练时间显著更少(不足SVM的一半),而SVM消耗了70–90%的可用内存,训练时间超过12小时。
  • 采用MCC进行阈值优化提升了预测可靠性,最优阈值范围为0.2(火焰)至0.7(大规模人群)。
  • 基于预测结果的抗议事件可视化呈现出与已知动荡热点区域一致的空间模式,验证了该模型在现实情境感知中的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。