Skip to main content
QUICK REVIEW

[论文解读] Future Frame Prediction Using Convolutional VRNN for Anomaly Detection

Yiwei Lu, Mahesh Kumar Krishna Reddy|arXiv (Cornell University)|Sep 5, 2019
Anomaly Detection Techniques and Applications参考文献 32被引用 11
一句话总结

该论文提出了一种卷积变分循环神经网络(Conv-VRNN),在变分自编码器(VAE)框架内通过ConvLSTM实现时间建模,以预测未来视频帧用于异常检测。该方法在三个基准数据集上优于最先进方法,无需依赖光流信息,AUC得分分别为86.26%(Ped1)、96.06%(Ped2)和85.78%(Avenue)。

ABSTRACT

Anomaly detection in videos aims at reporting anything that does not conform the normal behaviour or distribution. However, due to the sparsity of abnormal video clips in real life, collecting annotated data for supervised learning is exceptionally cumbersome. Inspired by the practicability of generative models for semi-supervised learning, we propose a novel sequential generative model based on variational autoencoder (VAE) for future frame prediction with convolutional LSTM (ConvLSTM). To the best of our knowledge, this is the first work that considers temporal information in future frame prediction based anomaly detection framework from the model perspective. Our experiments demonstrate that our approach is superior to the state-of-the-art methods on three benchmark datasets.

研究动机与目标

  • 为解决视频监控中异常数据稀疏且不平衡的挑战,实现无需人工标注异常的半监督异常检测。
  • 通过显式建模时间依赖性,利用循环结构改进视频未来帧预测,克服以往方法将帧视为静态输入的局限。
  • 开发一种通过端到端训练学习正常视频序列分布的生成模型,实现基于重建的异常检测。
  • 评估通过RNN显式建模时间动态是否比依赖光流等辅助运动特征更有效。

提出的方法

  • 使用基于ConvLSTM的编码器从输入帧序列中提取时间特征,并将其映射到潜在空间。
  • 采用带有随机瓶颈的VAE框架,对预测未来帧的不确定性进行建模,实现未来帧的生成建模。
  • 通过转置卷积的解码器从潜在表示重建未来帧,实现端到端训练。
  • 使用多组件损失函数进行模型优化:L1损失用于像素级重建,MSSSIM用于结构相似性,GDL(梯度差异损失)用于边缘和纹理保持。
  • 将RNN(ConvLSTM)直接集成到VAE架构中,以建模长程时间依赖性,从而提升静态帧编码器的预测质量。
  • 将预测未来帧与实际未来帧之间的重建误差作为异常得分,误差越高表示行为越异常。

实验结果

研究问题

  • RQ1与非循环模型相比,显式建模时间动态的序列生成模型是否能提升未来帧预测在视频异常检测中的性能?
  • RQ2Conv-VRNN的性能与使用光流或静态帧重建的最先进方法相比如何?
  • RQ3结合L1、MSSSIM和GDL多个损失组件是否能提升重建保真度并改善异常检测性能?
  • RQ4通过设计一种通过RNN内在捕捉运动的模型,是否可能在不依赖光流特征的情况下实现最先进性能?

主要发现

  • 所提出的Conv-VRNN在Ped1数据集上达到86.26%的AUC,比最佳基线模型(带光流的Conv-VAE)高出5.11个百分点。
  • 在Ped2数据集上,该模型达到96.06%的AUC,显著优于次佳方法(带光流的Conv-VAE)的89.52%。
  • 在Avenue数据集上,该模型达到85.78%的AUC,比使用光流的最先进方法高出3.55个百分点。
  • 消融实验表明,采用RNN时间建模的Conv-VRNN优于无RNN的Conv-VAE变体(Ped1上分别为86.26% vs 82.42%),证明了循环建模的重要性。
  • L1、MSSSIM和GDL损失的组合在Ped1上取得最佳性能(AUC 86.26%),表明多尺度结构和梯度约束能有效提升重建质量。
  • 即使不使用光流特征,Conv-VRNN仍优于将光流作为训练约束的Conv-VAE模型,表明端到端时间建模比辅助运动特征更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。