Skip to main content
QUICK REVIEW

[论文解读] A Discriminative Framework for Anomaly Detection in Large Videos

A. Giorno, J. Andrew Bagnell|arXiv (Cornell University)|Sep 28, 2016
Anomaly Detection Techniques and Applications参考文献 13被引用 22
一句话总结

本文提出了一种新颖的无监督异常检测框架,适用于大型视频,无需训练序列或时间顺序假设。通过将异常视为在同一流视频中易于与其他帧区分的帧,该方法在帧嵌入上使用置换检验来识别异常,即使在无训练数据的严格设置下,也在标准基准上实现了最先进性能。

ABSTRACT

We address an anomaly detection setting in which training sequences are unavailable and anomalies are scored independently of temporal ordering. Current algorithms in anomaly detection are based on the classical density estimation approach of learning high-dimensional models and finding low-probability events. These algorithms are sensitive to the order in which anomalies appear and require either training data or early context assumptions that do not hold for longer, more complex videos. By defining anomalies as examples that can be distinguished from other examples in the same video, our definition inspires a shift in approaches from classical density estimation to simple discriminative learning. Our contributions include a novel framework for anomaly detection that is (1) independent of temporal ordering of anomalies, and (2) unsupervised, requiring no separate training sequences. We show that our algorithm can achieve state-of-the-art results even when we adjust the setting by removing training sequences from standard datasets.

研究动机与目标

  • 解决在无独立训练序列且异常检测得分与时间顺序无关的视频中的异常检测问题。
  • 开发一种方法,仅从测试视频中推导上下文,避免依赖正常行为的预训练模型。
  • 实现在机器人、监控和个人视频分析等现实场景中的异常检测,这些场景中缺乏标注数据。
  • 构建一种对参数变化具有鲁棒性、并能处理复杂、长时视频内容而无需先验假设的框架。

提出的方法

  • 该方法将异常定义为在同一流视频中易于与其他帧区分的帧,从密度估计转向判别学习。
  • 采用基于置换的检验程序:将帧在视频中随机打乱,并训练一个二分类器以区分真实帧与打乱帧。
  • 使用预训练的CNN(例如,Inflated 3D ConvNet)提取帧嵌入,并在这些特征上训练分类器,以学习典型帧与异常帧之间的决策边界。
  • 每个帧的异常得分源自分类器在区分该帧与帧的随机置换版本时的置信度。
  • 该方法对异常顺序具有不变性,因为打乱操作保持了帧特征的分布。
  • 对正则化(λ)和窗口大小(tw)等超参数进行调优,并使用多次打乱以提升在次优设置下的鲁棒性。

实验结果

研究问题

  • RQ1是否可以在无任何训练序列或正常行为先验知识的情况下,有效实现视频中的异常检测?
  • RQ2当异常顺序不影响其检测得分时,方法如何实现高性能的异常检测?
  • RQ3在无显式监督的情况下,基于打乱帧训练的判别分类器在多大程度上能识别出真正的异常?
  • RQ4在复杂、现实的视频场景中,基于置换的检验策略是否能优于传统的密度估计方法?
  • RQ5在缺乏标注数据的情况下,该方法对超参数选择和特征表示质量的鲁棒性如何?

主要发现

  • 在Avenue数据集上,该方法在最优设置下实现了最先进性能,帧级AUC达到0.8958,即使未使用训练序列。
  • 在Subway数据集上,该方法在出口场景的AUC为0.8236,在入口场景为0.6913,显示出在监控场景中的强大性能。
  • 在UMN数据集的所有场景中,除一个场景外,该方法均优于[2],在所有视频上的平均AUC为0.91。
  • 在超参数次优时,训练期间对帧进行打乱可提升性能,表明对过拟合和不良正则化的鲁棒性。
  • 由于采用15帧的时间窗口,该算法可提前15帧检测到异常,但在动态场景中可能导致误报。
  • 尽管性能出色,该方法在模糊情形下仍存在困难——例如从右侧进入的人员——此时真实标签依赖于训练数据的上下文。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。