Skip to main content
QUICK REVIEW

[论文解读] Learning Regularity in Skeleton Trajectories for Anomaly Detection in Videos

Romero Morais, Vuong Le|arXiv (Cornell University)|Mar 8, 2019
Anomaly Detection Techniques and Applications参考文献 29被引用 11
一句话总结

该论文提出了一种新型的消息传递编码器-解码器循环神经网络(MPED-RNN),通过将人体骨骼轨迹分解为全局身体运动和局部姿态两部分,实现监控视频中的异常检测。通过在跨分支间进行消息传递来建模解耦的动力学,该方法在保持可解释性的同时实现了最先进(SOTA)的性能,其优势体现在语义有意义的特征可视化与决策解释上。

ABSTRACT

Appearance features have been widely used in video anomaly detection even though they contain complex entangled factors. We propose a new method to model the normal patterns of human movements in surveillance video for anomaly detection using dynamic skeleton features. We decompose the skeletal movements into two sub-components: global body movement and local body posture. We model the dynamics and interaction of the coupled features in our novel Message-Passing Encoder-Decoder Recurrent Network. We observed that the decoupled features collaboratively interact in our spatio-temporal model to accurately identify human-related irregular events from surveillance video sequences. Compared to traditional appearance-based models, our method achieves superior outlier detection performance. Our model also offers "open-box" examination and decision explanation made possible by the semantically understandable features and a network architecture supporting interpretability.

研究动机与目标

  • 解决基于外观的视频异常检测方法的局限性,这类方法通常存在高维、噪声大且无结构的特征,导致语义信息模糊。
  • 通过使用结构化且语义丰富的骨骼特征,提升深度学习模型的可解释性,支持开放盒分析。
  • 通过显式建模人类运动规律,将运动分解为全局运动与局部姿态动力学,提升异常检测性能。
  • 通过可视化各特征分量对最终异常分数的贡献,以及展示决策权重,实现模型可解释性,支持错误分析与领域知识融合。

提出的方法

  • 将2D骨骼轨迹分解为两个子分量:全局身体运动(场景中的整体身体动力学)与局部身体姿态(附着于身体坐标系中的骨骼构型)。
  • 设计一种消息传递编码器-解码器循环神经网络(MPED-RNN),包含两个独立的RNN分支分别处理全局与局部特征,并在每个时间步通过跨分支消息传递实现交互。
  • 通过正则化进行端到端训练,从训练序列中蒸馏出正常行为的紧凑且具有代表性的特征模式。
  • 通过暴露学习到的权重并可视化各特征分量对最终异常分数的贡献,支持可解释性。
  • 利用时空建模捕捉长距离依赖关系,并捕获全局与局部运动模式之间的动态交互。
  • 将消息传递框架扩展以支持非骨骼特征的集成,并为未来扩展至多人及物体级异常检测提供支持。

实验结果

研究问题

  • RQ1与端到端的基于外观的模型相比,将骨骼轨迹分解为全局运动与局部姿态是否能提升异常检测性能?
  • RQ2所提出的MPED-RNN模型在实现高性能的同时,能否通过语义清晰的特征表示维持良好的可解释性?
  • RQ3基于骨骼的异常检测的主要失败模式是什么?它们与骨骼检测不准确或运动-姿态相似性模糊性有何关联?
  • RQ4全局与局部RNN分支之间的消息传递机制如何增强模型检测细微异常的能力?
  • RQ5所提出的方法是否能在不同视频质量与异常类型的数据集上实现良好泛化?

主要发现

  • 在CUHK Avenue数据集的HR-Avenue子集上,MPED-RNN在帧级别实现了0.863的ROC AUC,优于Liu等人(0.862)和Conv-AE(0.848)。
  • 在ShanghaiTech数据集上,尽管仅使用约100维的骨骼特征(而传统方法使用2048维的ResNet特征),该模型在异常检测性能上仍优于传统基于外观的方法。
  • 主要错误来源是骨骼检测与跟踪不准确,特别是在低分辨率、有阴影或遮挡的场景中,导致异常事件被错误分类。
  • 一个显著的失败案例出现在异常动作(如缓慢骑自行车)产生与正常行走相似的骨骼姿态与运动模式时,由于骨骼特征的几何特性,导致出现假阴性。
  • 通过可视化贡献因素与决策权重,验证了模型的可解释性,支持错误分析与领域特定的模型优化。
  • 该方法的性能高度依赖于骨骼质量,提示未来工作应整合外观特征以补偿缺失或损坏的骨骼输入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。