Skip to main content
QUICK REVIEW

[论文解读] Lightning Fast Video Anomaly Detection via Adversarial Knowledge Distillation

Florinel-Alin Croitoru, Nicolae-Cătălin Ristea|arXiv (Cornell University)|Nov 28, 2022
Anomaly Detection Techniques and Applications参考文献 92被引用 4
一句话总结

本文提出了一种闪电般快速的帧级视频异常检测模型,通过一种新颖的结合标准与对抗性知识蒸馏的方式,从多个高精度的基于目标的教师模型中蒸馏知识。通过用逐点卷积层替换全连接层,并利用对抗性判别器优化低分辨率异常图,学生模型实现了1480 FPS的推理速度——比最快基线模型快七倍以上,同时在Avenue、ShanghaiTech和UCSD Ped2基准上保持了最先进水平的准确率。

ABSTRACT

We propose a very fast frame-level model for anomaly detection in video, which learns to detect anomalies by distilling knowledge from multiple highly accurate object-level teacher models. To improve the fidelity of our student, we distill the low-resolution anomaly maps of the teachers by jointly applying standard and adversarial distillation, introducing an adversarial discriminator for each teacher to distinguish between target and generated anomaly maps. We conduct experiments on three benchmarks (Avenue, ShanghaiTech, UCSD Ped2), showing that our method is over 7 times faster than the fastest competing method, and between 28 and 62 times faster than object-centric models, while obtaining comparable results to recent methods. Our evaluation also indicates that our model achieves the best trade-off between speed and accuracy, due to its previously unheard-of speed of 1480 FPS. In addition, we carry out a comprehensive ablation study to justify our architectural design choices. Our code is freely available at: https://github.com/ristea/fast-aed.

研究动机与目标

  • 解决监控系统中实时视频异常检测的高计算成本问题。
  • 克服依赖预训练检测器、导致每张GPU处理速度限制在20–50 FPS的基于目标模型的低效问题。
  • 开发一种帧级学生模型,使其在保持复杂基于目标教师模型准确率的同时,显著提升推理速度。
  • 通过引入对抗性判别器,提升知识蒸馏的保真度,使学生生成的异常图与教师模型对齐。
  • 在视频异常检测中实现速度与准确率的最佳权衡,支持在真实场景中的可扩展部署。

提出的方法

  • 在Transformer架构中,用逐点卷积层替换全连接层,以提升推理速度并保持特征表示能力。
  • 通过低分辨率异常图蒸馏,使用多个基于目标的教师模型(如基于YOLOv3的检测器)训练学生模型。
  • 采用标准蒸馏方法,通过学生与教师异常图之间的均方误差(MSE)损失,传递正常性模式。
  • 为每个教师模型引入对抗性判别器,以区分真实(教师)异常图与生成(学生)异常图,从而提升保真度与定位精度。
  • 采用两阶段训练流程:第一阶段重建中间帧,以学习正常的时空模式;第二阶段应用蒸馏损失,对齐异常图。
  • 通过聚合多样化基于目标检测器的知识,将框架扩展至多教师设置,提升模型鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1帧级学生模型是否能在显著更高的推理速度下,实现与最先进基于目标教师模型相当的异常检测性能?
  • RQ2将标准蒸馏与对抗性蒸馏结合,是否能相比仅使用标准蒸馏,显著提升学生生成异常图的保真度?
  • RQ3用逐点卷积层替换全连接层,在视频异常检测中对速度与准确率的提升程度如何?
  • RQ4在多个基准上,所提方法在速度-准确率权衡方面与现有方法相比表现如何?
  • RQ5在目标检测器失效的场景下(如飞舞的纸张等未知物体类别),学生模型是否能比教师模型更有效地检测异常?

主要发现

  • 所提学生模型在单张GPU上实现1480 FPS的推理速度,使其比最快竞争方法快七倍以上,且比基于目标的模型快28至62倍。
  • 在Avenue、ShanghaiTech和UCSD Ped2基准上,学生模型的微平均AUC分数与最先进基于目标教师模型的差距在5%以内,UCSD Ped2上峰值AUC达到98.63%。
  • 在ShanghaiTech测试视频01_0136上,学生模型的AUC比最佳教师模型(T₁)高出12.3%,证明其在模型复杂度更低的情况下仍具备更优的泛化能力。
  • 学生模型成功检测到包含未知或罕见物体(如飞舞的纸张)区域的异常,而基于YOLOv3的教师模型因类别限制而失效。
  • 将全连接层替换为逐点卷积层,不仅将推理速度从1267 FPS提升至1480 FPS,还将微平均AUC从71.8%提升至85.0%,证实了该架构改进的有效性。
  • 对抗性蒸馏显著提升了学生生成异常图的平滑性与定位质量,减少了误报并增强了模型鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。