[论文解读] Attentioned Convolutional LSTM InpaintingNetwork for Anomaly Detection in Videos
本文提出了一种带有注意力机制的卷积LSTM图像修复网络,用于无监督视频异常检测,其中使用部分遮挡的帧和先前帧作为输入来重建当前帧。该模型采用卷积注意力机制以增强时空上下文建模能力,并利用重建误差(对数似然)作为异常评分,在损坏的Moving MNIST基准测试中实现了87%的等错误率(EER),优于VPN和Conv-LSTM基线模型。
We propose a semi-supervised model for detecting anomalies in videos inspiredby the Video Pixel Network [van den Oord et al., 2016]. VPN is a probabilisticgenerative model based on a deep neural network that estimates the discrete jointdistribution of raw pixels in video frames. Our model extends the Convolutional-LSTM video encoder part of the VPN with a novel convolutional based attentionmechanism. We also modify the Pixel-CNN decoder part of the VPN to a frameinpainting task where a partially masked version of the frame to predict is given asinput. The frame reconstruction error is used as an anomaly indicator. We test ourmodel on a modified version of the moving mnist dataset [Srivastava et al., 2015]. Our model is shown to be effective in detecting anomalies in videos. This approachcould be a component in applications requiring visual common sense.
研究动机与目标
- 开发一种可在边缘设备上高效运行的实时无监督视频异常检测系统。
- 通过集成动态卷积注意力机制,提升基于视频重建的异常检测中空间与时间上下文建模能力。
- 通过使用部分遮挡的输入帧,实现并行推理,避免对序列遮挡卷积的依赖。
- 评估所提出架构在检测视频序列中空间异常(像素损坏)和时间异常(帧顺序反转)方面的有效性。
提出的方法
- 该模型使用卷积LSTM编码器从视频帧序列中提取时空特征。
- 提出一种基于卷积的新型注意力机制,生成与输入相关的滤波器,以增强上下文窗口中的局部空间结构感知能力。
- 解码器的输入包括部分遮挡的当前帧(通过网格遮罩使约95%的像素被遮挡),使模型能够利用未遮挡邻域上下文来重建缺失区域。
- 解码器为修改后的Pixel-CNN,通过使用遮挡卷积保持自回归依赖流,实现像素值的并行预测,完成帧图像修复。
- 损失函数为给定预测分布下真实像素值的负对数似然,用作异常评分。
- 推理过程中,低对数似然值表示异常,因为模型会为意外或损坏的像素值分配低概率。
实验结果
研究问题
- RQ1与标准全局注意力或无注意力机制相比,卷积注意力机制是否能提升基于视频重建的异常检测中的空间上下文建模能力?
- RQ2使用部分遮挡帧作为输入是否能在保持重建质量的同时实现有效的并行推理?
- RQ3所提出的模型在检测视频序列中的空间与时间异常方面,与基线模型(VPN和Conv-LSTM)相比表现如何?
- RQ4注意力机制与遮挡图像修复的结合在基准数据集上在多大程度上提升了异常检测性能?
主要发现
- 所提模型在损坏的Moving MNIST数据集上实现了87%的等错误率(EER),优于基线模型Conv-LSTM(70.3%)和VPN(82.1%)。
- 若移除遮挡帧输入,性能下降至84.6% EER,表明遮挡输入在实现有效图像修复与异常检测中起着关键作用。
- 若省略卷积注意力机制,EER升至85.7%,表明注意力机制显著增强了模型捕捉局部空间结构的能力。
- 该模型成功检测到空间异常(如3×3黑色像素损坏)和时间异常(如帧顺序反转),表现为损失图中对应区域的高损失值。
- 重建误差(对数似然)能有效识别异常像素,对损坏像素(如零值黑色方块)预测概率较低。
- 使用约95%像素被遮挡的网格遮罩,迫使模型依赖时间上下文和未遮挡邻近像素,从而提升了对空间损坏的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。