Skip to main content
QUICK REVIEW

[论文解读] Two-stream Multi-dimensional Convolutional Network for Real-time Violence Detection

Dipon Kumar Ghosh, Amitabha Chakrabarty|arXiv (Cornell University)|Nov 8, 2022
Anomaly Detection Techniques and Applications被引用 5
一句话总结

本文提出了一种轻量级双流多维卷积网络(2s-MDCN),通过联合处理RGB帧与光流信息实现实时暴力行为检测。通过并行应用1D、2D和3D卷积从相同时空位置提取空间与时间特征,该模型减少了信息损失,并在RWF-2000数据集上实现了89.7%的最先进准确率,参数量仅0.92M,计算复杂度为8.97 GFLOPs。

ABSTRACT

The increasing number of surveillance cameras and security concerns have made automatic violent activity detection from surveillance footage an active area for research. Modern deep learning methods have achieved good accuracy in violence detection and proved to be successful because of their applicability in intelligent surveillance systems. However, the models are computationally expensive and large in size because of their inefficient methods for feature extraction. This work presents a novel architecture for violence detection called Two-stream Multi-dimensional Convolutional Network (2s-MDCN), which uses RGB frames and optical flow to detect violence. Our proposed method extracts temporal and spatial information independently by 1D, 2D, and 3D convolutions. Despite combining multi-dimensional convolutional networks, our models are lightweight and efficient due to reduced channel capacity, yet they learn to extract meaningful spatial and temporal information. Additionally, combining RGB frames and optical flow yields 2.2% more accuracy than a single RGB stream. Regardless of having less complexity, our models obtained state-of-the-art accuracy of 89.7% on the largest violence detection benchmark dataset.

研究动机与目标

  • 解决现有深度学习模型在监控系统中实时暴力检测的低效与高计算成本问题。
  • 通过同时处理空间与时间特征而非顺序处理,减少时空特征提取过程中的信息损失。
  • 开发一种轻量级但高精度的模型,适用于Jetson Nano等边缘设备的部署。
  • 在不显著增加模型复杂度的前提下,通过融合RGB与光流流道提升检测准确率。
  • 为未来实时暴力行为检测研究建立一个强大且高效的基线。

提出的方法

  • 模型采用双流架构,分别设置RGB帧与光流的独立分支,实现空间与运动信息的并行处理。
  • 空间特征通过单帧上的2D与1D卷积提取,而时间动态则通过连续帧间的3D卷积捕捉。
  • 1D、2D与3D卷积层的融合使模型能够从同一时空点学习多尺度、多维特征。
  • 两流的特征图经过拼接后,输入全连接层完成最终分类。
  • 通过减少通道容量与高效架构设计,优化模型以实现极低的参数量与计算成本。
  • 训练采用交叉熵损失,并结合早停策略,以防止过拟合,如训练/验证损失曲线所示。

实验结果

研究问题

  • RQ1与顺序处理相比,双流多维CNN架构是否能提升实时暴力检测的时空特征提取效果?
  • RQ2在保持低计算复杂度的前提下,RGB与光流输入的融合对检测准确率有何影响?
  • RQ3轻量级模型在RWF-2000等大规模暴力检测基准上,能在多大程度上实现最先进性能?
  • RQ4所提出的2s-MDCN在Jetson Nano等边缘设备上的推理速度与可部署性表现如何?
  • RQ5与传统顺序特征提取相比,并行提取空间与时间特征是否能更有效地减少信息损失?

主要发现

  • 2s-MDCN在RWF-2000基准数据集上实现了89.7%的最先进准确率,优于包括FlowGate(融合)在内的现有模型。
  • 与仅使用RGB帧相比,RGB与光流流道的融合使准确率提升了2.2%。
  • 在Hockey-fight数据集上达到100.0%的准确率,在Movies-fight数据集上达到99.0%,表明其在不同数据集间具有强大的泛化能力。
  • 仅含0.92百万参数与8.97 GFLOPs的计算复杂度,该模型在实现更高准确率的同时,显著优于FlowGate(16.98 GFLOPs)。
  • 在Jetson Nano边缘设备上,2s-MDCN仅使用RGB输入即可实现80 FPS的视频处理速度,较FlowGate(58.18 FPS)提升超过37%。
  • 模型训练过程稳定,仅在第25至35个周期间出现轻微过拟合,且随着训练推进已得到缓解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。