[论文解读] MGFN: Magnitude-Contrastive Glance-and-Focus Network for Weakly-Supervised Video Anomaly Detection
该论文提出MGFN,一种新颖的凝视-聚焦网络,结合特征增强与幅度对比损失,用于弱监督视频异常检测。通过模仿人类视觉注意力机制,先捕捉全局上下文,再聚焦于局部异常,并通过对比损失学习场景自适应的特征幅度,MGFN在UCF-Crime数据集上达到86.98% AUC,在XD-Violence数据集上达到80.11% AP,性能达到当前最先进水平。
Weakly supervised detection of anomalies in surveillance videos is a challenging task. Going beyond existing works that have deficient capabilities to localize anomalies in long videos, we propose a novel glance and focus network to effectively integrate spatial-temporal information for accurate anomaly detection. In addition, we empirically found that existing approaches that use feature magnitudes to represent the degree of anomalies typically ignore the effects of scene variations, and hence result in sub-optimal performance due to the inconsistency of feature magnitudes across scenes. To address this issue, we propose the Feature Amplification Mechanism and a Magnitude Contrastive Loss to enhance the discriminativeness of feature magnitudes for detecting anomalies. Experimental results on two large-scale benchmarks UCF-Crime and XD-Violence manifest that our method outperforms state-of-the-art approaches.
研究动机与目标
- 解决现有弱监督视频异常检测方法在长视频中定位异常时因缺乏全局上下文感知能力而带来的局限性。
- 克服仅依赖幅度监督时,不同场景间特征幅度不一致对异常检测性能造成的负面影响。
- 通过学习场景自适应的特征幅度分布,提升特征判别性,从而更有效地分离正常与异常事件。
- 构建一个统一框架,整合全局时序上下文与局部空间细节,实现更精确、更鲁棒的异常定位。
提出的方法
- 提出一种凝视-聚焦(GF)网络架构,首先处理整个视频序列以捕捉长期时序上下文(凝视),随后在局部片段上优化检测(聚焦)。
- 引入特征增强机制(FAM),提升模型对特征幅度变化的敏感度,从而增强异常检测的表征学习能力。
- 设计幅度对比(MC)损失,鼓励同一类别(正常或异常)视频间特征幅度的相似性,同时最大化不同类别之间的可分性。
- 采用视频级弱监督进行模型训练,利用MC损失在无需帧级标注的情况下学习具有判别性的特征幅度。
- 将GF模块与FAM及MC损失集成于端到端可训练的框架中,实现全局上下文建模与局部异常敏感度的联合优化。
- 采用双流特征提取策略,分别处理全局与局部特征后再进行融合,GF机制确保信息从全局到局部的有效传递。
实验结果
研究问题
- RQ1凝视-聚焦机制是否能通过整合全局上下文与局部细节,提升长视频中的异常定位能力?
- RQ2不同场景间特征幅度的不一致性是否会降低基于幅度的异常检测方法的性能?
- RQ3一种学习场景自适应特征幅度分布的对比损失,能否提升正常与异常特征之间的可分性?
- RQ4所提出的特征增强机制在多大程度上提升了模型检测细微或低幅度异常的能力?
- RQ5在弱监督设置下,凝视-聚焦、FAM与MC损失的组合为何能超越现有最先进方法?
主要发现
- MGFN在UCF-Crime数据集上达到86.98% AUC,在XD-Violence数据集上达到80.11% AP,优于当前最先进方法。
- 消融实验表明,加入凝视-聚焦机制后,UCF-Crime数据集上的AUC从82.66%(FF)提升至85.80%,验证了其在融合全局与局部特征方面的有效性。
- 仅使用特征增强机制(FAM)时,UCF-Crime数据集上的AUC提升1.65个百分点,XD-Violence数据集上的AP提升1.02个百分点,表明特征敏感度得到增强。
- 仅使用幅度对比(MC)损失时,UCF-Crime数据集上的AUC提升2.85个百分点,XD-Violence数据集上的AP提升3.69个百分点,证实其在增强特征判别性方面的重要作用。
- FAM与MC损失联合使用时性能最佳(AUC 86.98%,AP 80.11%),表明二者在提升检测鲁棒性方面具有互补效应。
- 定性结果表明,MGFN即使在包含多个异常片段的复杂场景中也能准确定位异常,并在具有动态运动的正常视频中保持较低的误报率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。