Skip to main content
QUICK REVIEW

[论文解读] Detecting Violence in Video using Subclasses

Xirong Li, Yujia Huo|arXiv (Cornell University)|Apr 27, 2016
Human Pose and Action Recognition参考文献 14被引用 5
一句话总结

本文提出了一种基于子类的视频暴力检测方法,通过引入10种视觉上显著不同的暴力子类细粒度标注,以改进多模态特征融合。通过利用这些子类,该方法在MediaEval 2015测试集上实现了0.303的AP和0.55的P100,优于最先进系统,并表明在使用子类时,运动特征是可有可无的。

ABSTRACT

This paper attacks the challenging problem of violence detection in videos. Different from existing works focusing on combining multi-modal features, we go one step further by adding and exploiting subclasses visually related to violence. We enrich the MediaEval 2015 violence dataset by \emph{manually} labeling violence videos with respect to the subclasses. Such fine-grained annotations not only help understand what have impeded previous efforts on learning to fuse the multi-modal features, but also enhance the generalization ability of the learned fusion to novel test data. The new subclass based solution, with AP of 0.303 and P100 of 0.55 on the MediaEval 2015 test set, outperforms several state-of-the-art alternatives. Notice that our solution does not require fine-grained annotations on the test set, so it can be directly applied on novel and fully unlabeled videos. Interestingly, our study shows that motion related features, though being essential part in previous systems, are dispensable.

研究动机与目标

  • 为解决暴力检测模型在不同数据集间泛化困难的问题,通过分析训练集与测试集之间子类分布的差异。
  • 探究为何在理论上有优势的“学习融合”方法在以往工作中表现不佳。
  • 通过引入并利用细粒度子类标注,提升暴力检测的泛化能力和性能。
  • 确定在考虑子类时,不同模态(视觉、音频、运动)在暴力检测中的相对重要性。
  • 开发一种系统,无需在测试数据上进行细粒度标注,从而可直接部署于新型、完全无标注的视频上。

提出的方法

  • 作者基于95个概念的优化词汇表,对MediaEval 2015数据集中的10,900个视频片段进行了人工标注,标注了10种视觉上不同的暴力子类,如“武器”、“死亡”、“瞄准”和“捆绑”。
  • 子类标注源自52个中间层概念的子集,仅保留在开发集中至少出现20次的概念,最终得到10种子类。
  • 使用多模态特征集,包括深度卷积神经网络特征(如gnet、g4k)、音频特征(MFCC)和运动描述符(如HOG、密集轨迹),并为每种子类训练了特定的分类器。
  • 通过在验证集上调整融合权重,应用了“学习融合”策略,比较了有无子类监督下的学习融合与平均融合方法。
  • 使用标准指标对系统进行了评估:在官方MediaEval 2015测试集上的平均精度(AP)、前10项精度(P10)和前100项精度(P100)。
  • 将该方法与MediaEval 2015竞赛中的三种最先进系统进行了比较,包括Fudan-Huawei、MIC-TJU和NII-UIT。

实验结果

研究问题

  • RQ1为何以往的视频暴力检测“学习融合”方法尽管具有理论优势,却未能超越简单的平均融合?
  • RQ2子类级别的标注如何影响多模态融合模型在新型、未见测试数据上的泛化能力?
  • RQ3在使用细粒度子类时,视觉、音频或运动模态中哪一个在暴力检测中最有效?
  • RQ4在测试数据上无需细粒度标注的情况下,是否可以训练出一个能泛化到新测试集的系统?
  • RQ5与整体暴力检测相比,子类级别监督是否能实现更有效、更鲁棒的多模态特征融合?

主要发现

  • 所提出的基于子类的方法在MediaEval 2015测试集上实现了0.303的AP和0.55的P100,优于三种最先进系统。
  • 子类标注解决了开发集与测试集之间存在的跨数据集分布偏移问题,该问题被确定为以往“学习融合”方法泛化性能差的关键原因。
  • 在使用子类时,学习融合策略显著优于平均融合,13种组合中有11种表现优于平均融合。
  • 尽管运动特征在以往系统中占据核心地位,但在应用子类监督后,其作用被证明是可有可无的,因为其贡献在子类特定视觉线索存在时显著降低。
  • 在考虑子类时,仅使用图像和音频模态而无需运动特征,可获得最佳性能,表明在子类监督下模态间的互补性发生了变化。
  • 该方法在新型、完全无标注的视频上泛化良好,因为它在测试时无需子类标注,可直接部署于真实世界场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。