Skip to main content
QUICK REVIEW

[论文解读] Video Anomaly Detection by Solving Decoupled Spatio-Temporal Jigsaw Puzzles

Guodong Wang, Yunhong Wang|arXiv (Cornell University)|Jul 20, 2022
Anomaly Detection Techniques and Applications被引用 5
一句话总结

本文提出一种自监督视频异常检测方法,通过完整排列生成多样化、具有挑战性的训练信号,解决解耦的时空拼图问题——空间拼图用于学习外观,时间拼图用于学习运动。该方法在三个基准测试上达到最先进性能,显著优于重建和预测基线方法,尤其在ShanghaiTech Campus数据集上达到84.3% AUROC。

ABSTRACT

Video Anomaly Detection (VAD) is an important topic in computer vision. Motivated by the recent advances in self-supervised learning, this paper addresses VAD by solving an intuitive yet challenging pretext task, i.e., spatio-temporal jigsaw puzzles, which is cast as a multi-label fine-grained classification problem. Our method exhibits several advantages over existing works: 1) the spatio-temporal jigsaw puzzles are decoupled in terms of spatial and temporal dimensions, responsible for capturing highly discriminative appearance and motion features, respectively; 2) full permutations are used to provide abundant jigsaw puzzles covering various difficulty levels, allowing the network to distinguish subtle spatio-temporal differences between normal and abnormal events; and 3) the pretext task is tackled in an end-to-end manner without relying on any pre-trained models. Our method outperforms state-of-the-art counterparts on three public benchmarks. Especially on ShanghaiTech Campus, the result is superior to reconstruction and prediction-based methods by a large margin.

研究动机与目标

  • 通过利用自监督学习,在缺乏标注异常数据的情况下解决视频异常检测(VAD)的挑战。
  • 克服现有重建和预测基线方法的局限性,这些方法通常因对正常模式的强泛化能力而难以检测细微异常。
  • 设计一种比二分类或简单对比学习更具判别性的掩蔽任务,以捕捉正常与异常事件之间的细粒度时空差异。
  • 通过仅使用正常视频数据端到端训练模型,消除对ImageNet或Kinetics预训练的依赖。
  • 通过解耦空间和时间拼图任务并使用完整排列来提升任务多样性与难度,从而改善模型优化与特征学习。

提出的方法

  • 将时空拼图任务解耦为两个独立任务:空间拼图(重排帧内图像块)和时间拼图(重排视频片段中的连续帧),以实现对外观和运动模式的专注学习。
  • 使用全部 $n!$ 种可能排列(而非子集)生成多样化拼图,提升任务难度,并提供细粒度的监督信号以区分细微异常。
  • 将拼图求解任务重新表述为多标签分类问题:预测每个图像块(空间)或帧(时间)的原始位置,而非单一排列类别。
  • 端到端训练模型,无需任何预训练主干网络,直接从打乱输入中优化时空重建。
  • 在训练和推理过程中同时应用空间和时间拼图求解器,消融实验表明多任务学习可提升性能。
  • 使用标准I3D或类似主干网络提取特征,分别设置空间和时间拼图预测的头网络,通过多标签位置预测任务的交叉熵损失进行训练。

实验结果

研究问题

  • RQ1求解解耦的时空拼图能否作为视频异常检测的强自监督掩蔽任务?
  • RQ2与启发式子集相比,使用完整排列是否能提升模型检测细微时空异常的能力?
  • RQ3同时求解空间和时间拼图的多任务学习是否比单任务学习更有效于异常检测?
  • RQ4与旋转预测、时间方向等其他自监督掩蔽任务相比,该方法在VAD性能上表现如何?
  • RQ5该方法能否在不依赖预训练模型的前提下,泛化至物体级和帧级异常检测?

主要发现

  • 所提方法在Avenue数据集上达到92.2% AUROC,在ShanghaiTech Campus(STC)数据集上达到84.3% AUROC,显著优于先前最先进方法,尤其在重建和预测基线方法上优势明显。
  • 在STC数据集上,当训练和推理阶段同时求解空间和时间拼图时(C5),AUROC达到84.3%,相比单任务变体(C1)提升6.1个百分点(78.6% AUROC)。
  • 消融实验证实,训练阶段同时求解空间和时间拼图至关重要:若仅使用其中一类,性能显著下降,表明异常通常同时涉及外观与运动异常。
  • 该方法优于旋转预测、时间方向判断和时间顺序验证等替代掩蔽任务,最佳结果(84.3% AUROC)在结合空间与时间拼图求解时达成。
  • 在RetroTrucks数据集上,该方法在帧级检测中达到72.8% AUROC,超越先前最先进方法(71.5% AUROC),后者依赖物体交互推理。
  • 该模型在无任何预训练权重的情况下仍表现强劲,表明所提掩蔽任务足够有效,可从零开始学习判别性表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。