Skip to main content
QUICK REVIEW

[论文解读] Explainable Event Recognition

Imran Khan, Kashif Ahmad|arXiv (Cornell University)|Oct 2, 2021
Anomaly Detection Techniques and Applications被引用 4
一句话总结

本文提出了一种基于Grad-CAM和Xception卷积神经网络的可解释事件识别框架,用于解释基于图像的事件识别模型的决策过程。结果表明,78–84%的预测基于与事件相关的显著对象/区域,自然灾难、社交事件和体育赛事的F1分数分别为0.91、0.94和0.97,验证了模型的可解释性与泛化能力。

ABSTRACT

The literature shows outstanding capabilities for CNNs in event recognition in images. However, fewer attempts are made to analyze the potential causes behind the decisions of the models and exploring whether the predictions are based on event-salient objects or regions? To explore this important aspect of event recognition, in this work, we propose an explainable event recognition framework relying on Grad-CAM and an Xception architecture-based CNN model. Experiments are conducted on three large-scale datasets covering a diversified set of natural disasters, social, and sports events. Overall, the model showed outstanding generalization capabilities obtaining overall F1-scores of 0.91, 0.94, and 0.97 on natural disasters, social, and sports events, respectively. Moreover, for subjective analysis of activation maps generated through Grad-CAM for the predicted samples of the model, a crowdsourcing study is conducted to analyze whether the model's predictions are based on event-related objects/regions or not? The results of the study indicate that 78%, 84%, and 78% of the model decisions on natural disasters, sports, and social events datasets, respectively, are based onevent-related objects or regions.

研究动机与目标

  • 为解决基于深度学习的事件识别模型中可解释性不足的问题,特别是判断预测是否依赖于与事件相关的显著对象或区域。
  • 通过分析激活图,评估模型决策是否基于语义相关的视觉内容。
  • 在包括自然灾难、社交事件和体育赛事在内的多样化事件类别中,建立可解释事件识别的基线。
  • 开展众包研究,验证模型预测是否基于与事件相关的视觉线索。

提出的方法

  • 该框架采用在ImageNet上预训练的Xception架构进行特征提取与事件分类。
  • 应用Grad-CAM从最后一层卷积层生成类别激活图,突出显示对预测贡献最大的区域。
  • 可视化并分析激活图,以确定显著区域是否与事件相关对象或场景一致。
  • 通过三位标注者的一致性投票,开展众包研究,标注每项预测是否基于事件显著区域。
  • 在三个大规模数据集上评估模型:自然灾难、社交事件和体育赛事,涵盖多样的视觉与语义复杂性。
  • 通过F1分数和主观分析准确率评估模型性能,以衡量预测能力与可解释性。

实验结果

研究问题

  • RQ1图像的哪些部分对模型预测贡献最大,且是否与事件显著对象或区域一致?
  • RQ2模型的预测是否依赖于与事件相关的视觉内容,还是受无关图像成分的影响?
  • RQ3模型的决策对人类观察者是否具有可解释性与语义意义?
  • RQ4该模型在自然灾难、社交事件和体育赛事等多样化事件类别中的泛化能力如何?

主要发现

  • 模型在自然灾难、社交事件和体育赛事数据集上的F1分数分别为0.91、0.94和0.97,表明其具有较强的泛化能力。
  • 主观分析显示,78%的自然灾难预测、84%的社交事件预测和78%的体育赛事预测基于事件显著对象或区域。
  • 单个类别的最高准确率为0.98(冰球项目),最低为0.53(F1赛车),表明存在类别特异性挑战。
  • 误分类通常源于与混淆类别存在视觉相似性,或缺乏清晰的事件显著对象。
  • 尽管性能表现强劲,但当前准确率(78–84%)与理想的100%之间仍存在差距,表明事件显著性建模仍有改进空间。
  • 激活图证实,模型主要关注与事件相关的区域,验证了Grad-CAM在此场景下的可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。