[论文解读] Self-trained Deep Ordinal Regression for End-to-End Video Anomaly Detection
本文提出了一种自训练深度序数回归框架,用于端到端视频异常检测,消除了对人工标注正常数据的依赖,并实现了表示学习与异常评分的联合优化。通过将异常检测建模为一种代理的二分类序数回归任务,并结合迭代自训练,该方法在八个真实世界数据集上实现了最先进性能,具备优异的异常定位能力与人机协同适应性。
Video anomaly detection is of critical practical importance to a variety of real applications because it allows human attention to be focused on events that are likely to be of interest, in spite of an otherwise overwhelming volume of video. We show that applying self-trained deep ordinal regression to video anomaly detection overcomes two key limitations of existing methods, namely, 1) being highly dependent on manually labeled normal training data; and 2) sub-optimal feature learning. By formulating a surrogate two-class ordinal regression task we devise an end-to-end trainable video anomaly detection approach that enables joint representation learning and anomaly scoring without manually labeled normal/abnormal data. Experiments on eight real-world video scenes show that our proposed method outperforms state-of-the-art methods that require no labeled training data by a substantial margin, and enables easy and accurate localization of the identified anomalies. Furthermore, we demonstrate that our method offers effective human-in-the-loop anomaly detection which can be critical in applications where anomalies are rare and the false-negative cost is high.
研究动机与目标
- 解决现有视频异常检测方法依赖大量人工标注正常训练数据的局限性。
- 通过实现特征学习与异常评分的联合优化,克服两阶段方法中次优的特征学习问题。
- 开发一种支持通过伪标签进行弱监督的自训练端到端可训练框架。
- 为高风险应用场景中对低假阴性率有严格要求的场景,实现有效的“人机协同”异常检测。
- 利用类激活映射(CAM)技术,实现异常的精确时空定位。
提出的方法
- 将视频异常检测建模为一种代理的二分类序数回归任务,以支持端到端训练。
- 使用预训练主干网络(如ResNet-50)初始化模型,并通过通用无监督异常检测器生成伪标签。
- 应用迭代自训练以在多个训练周期内优化伪标签并提升异常评分预测性能。
- 将可微分的特征提取器(基于CNN)与全连接异常评分头集成,实现联合优化。
- 采用弱监督学习范式,其中初始伪标签由无监督基线方法(如iForest和Sp+)生成。
- 利用类激活映射(CAM)生成显著性图,以实现异常区域的精确定位。
实验结果
研究问题
- RQ1自训练深度序数回归方法是否能在不依赖任何标注正常数据的前提下,超越现有最先进无监督视频异常检测方法?
- RQ2与两阶段方法相比,特征学习与异常评分的端到端训练是否能带来更优的检测性能?
- RQ3在异常率各异的多样化视频数据集上,迭代自训练在多大程度上能提升检测性能?
- RQ4所提方法是否能通过支持专家反馈的便捷集成,实现有效的“人机协同”异常检测?
- RQ5与基线方法相比,该模型在异常区域定位方面的表现如何?其在不同视频领域之间是否具备良好的泛化能力?
主要发现
- 所提方法在八个真实世界视频数据集上均实现了最先进性能,显著优于现有无需任何标注数据的无监督方法。
- 在UMN数据集上,该方法实现了97.4%的AUC,展现出在多样化异常类型与视频场景下的强大泛化能力。
- 自训练在所有数据集上均提升了AUC性能,且在前几次迭代中提升最为显著,约4–5轮后趋于稳定。
- 即使使用与两阶段基线方法(如Del Giorno et al. [8] #2)相同的特征输入,该方法仍持续表现更优,证明了端到端优化的优势。
- 通过基于CAM的显著性图,模型能够实现精确的异常定位,成功突出显示了车辆穿越行人区域或人员向各个方向奔跑等异常区域。
- 该方法对主干网络架构的变化具有鲁棒性,在VGG、3DConv和ResNet-50上均表现出色,表明其在不同网络设计间具备良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。