[论文解读] Abnormal Event Detection in Urban Surveillance Videos Using GAN and Transfer Learning
该论文提出了一种基于生成对抗网络(GAN)的异常事件检测方法,用于城市监控视频,通过利用预训练的VGG16网络进行迁移学习,并结合光流分析,联合建模时空外观与运动特征。该方法在UCSD Peds1数据集上实现了14%的帧级EER和93%的AUC,在UCSD Peds2数据集上实现了15%的帧级EER和17%的像素级EER,展现出在人群场景中检测和定位异常事件时的卓越准确性和效率。
Abnormal event detection (AED) in urban surveillance videos has multiple challenges. Unlike other computer vision problems, the AED is not solely dependent on the content of frames. It also depends on the appearance of the objects and their movements in the scene. Various methods have been proposed to address the AED problem. Among those, deep learning based methods show the best results. This paper is based on deep learning methods and provides an effective way to detect and locate abnormal events in videos by handling spatio temporal data. This paper uses generative adversarial networks (GANs) and performs transfer learning algorithms on pre trained convolutional neural network (CNN) which result in an accurate and efficient model. The efficiency of the model is further improved by processing the optical flow information of the video. This paper runs experiments on two benchmark datasets for AED problem (UCSD Peds1 and UCSD Peds2) and compares the results with other previous methods. The comparisons are based on various criteria such as area under curve (AUC) and true positive rate (TPR). Experimental results show that the proposed method can effectively detect and locate abnormal events in crowd scenes.
研究动机与目标
- 解决城市监控视频中异常事件检测(AED)的挑战,其中异常性具有主观性和情境依赖性。
- 克服传统方法依赖手工设计特征、在遮挡、透视失真和高时间复杂度方面表现不佳的局限性。
- 开发一种高效的基于深度学习的AED系统,有效建模时空视频数据中的外观与运动模式。
- 通过使用预训练的VGG16网络进行特征提取,应用迁移学习以减少训练时间并提升模型效率。
- 通过结合生成对抗网络与基于光流的运动分析,在帧级和像素级均实现高检测准确率。
提出的方法
- 采用双流架构:一条流使用迁移学习的预训练VGG16网络处理RGB帧,以提取外观特征。
- 第二条流提取光流图像以建模运动动态,并将其转换为三维时空表示。
- 采用生成对抗网络(GAN),其中判别器通过预训练VGG16的特征进行微调,以学习正常视频模式。
- 应用基于网格的时空块划分策略,将视频帧划分为固定大小的三维块,以实现异常的局部化检测。
- 在正常视频序列上以无监督方式训练GAN,学习区分正常与异常的时空模式。
- 利用GAN生成器的重建误差和判别器的置信度来识别异常帧并定位异常像素。
实验结果
研究问题
- RQ1基于GAN的模型能否通过联合建模外观与运动特征,有效检测城市监控视频中的异常事件?
- RQ2在无监督设置下,从预训练的VGG16网络进行迁移学习在多大程度上提升了异常事件检测的效率与性能?
- RQ3结合基于光流的运动分析在多大程度上增强了对快速或低速运动等异常行为的检测能力?
- RQ4在基准数据集上,该方法在AUC、EER和计算效率方面与SOTA方法相比表现如何?
- RQ5该模型能否在保持低推理时间的前提下,同时实现在帧级和像素级异常定位的高精度?
主要发现
- 在UCSD Peds1数据集上,所提方法实现了14%的帧级EER和93%的AUC,优于先前方法如MDT(25% EER,81% AUC)和AMDN(16% EER,92% AUC)。
- 在更具挑战性的UCSD Peds2数据集上,该方法实现了15%的帧级EER和17%的像素级EER,显著优于MDT(24%和54%)与AMDN(16%和42%)。
- 该方法在像素级评估中表现出色,UCSD Peds1的AUC达到73%,UCSD Peds2的EER为17%,表明其具有强大的定位准确性。
- 利用VGG16的迁移学习显著减少了训练时间并提升了收敛速度,实现了无需完整微调的高效特征提取。
- 在标准个人计算机上,每帧的平均推理时间为0.312秒,其中分类耗时最长(0.290秒),表明通过GPU加速具备实时部署潜力。
- 外观与运动建模的结合使得该方法能有效检测多种异常行为,包括快速移动的滑板者、手推车和低速骑行者,即使在遮挡和透视失真等复杂条件下也表现良好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。