Skip to main content
QUICK REVIEW

[论文解读] Skeletal Video Anomaly Detection using Deep Learning: Survey, Challenges and Future Directions

Pratik K. Mishra, Alex Mihailidis|arXiv (Cornell University)|Dec 31, 2022
Anomaly Detection Techniques and Applications被引用 6
一句话总结

本文综述了基于深度学习的骨骼视频异常检测方法,利用人体关节点位置检测异常行为,同时保护隐私,避免基于面部和外观的识别。该方法通过在骨骼序列上采用重建、预测及混合模型,实现高精度异常检测,为医疗和住宅环境中的RGB系统提供了一种保护隐私的替代方案。

ABSTRACT

The existing methods for video anomaly detection mostly utilize videos containing identifiable facial and appearance-based features. The use of videos with identifiable faces raises privacy concerns, especially when used in a hospital or community-based setting. Appearance-based features can also be sensitive to pixel-based noise, straining the anomaly detection methods to model the changes in the background and making it difficult to focus on the actions of humans in the foreground. Structural information in the form of skeletons describing the human motion in the videos is privacy-protecting and can overcome some of the problems posed by appearance-based features. In this paper, we present a survey of privacy-protecting deep learning anomaly detection methods using skeletons extracted from videos. We present a novel taxonomy of algorithms based on the various learning approaches. We conclude that skeleton-based approaches for anomaly detection can be a plausible privacy-protecting alternative for video anomaly detection. Lastly, we identify major open research questions and provide guidelines to address them.

研究动机与目标

  • 通过用骨骼表征替代基于外观的特征,解决基于视频的异常检测中的隐私问题。
  • 克服RGB视频方法的局限性,如对光照、背景杂乱和面部识别的敏感性,这些因素阻碍了其在临床和家庭环境中的部署。
  • 基于新型学习方法分类体系,对基于深度学习的骨骼异常检测方法进行综述与分类。
  • 识别当前数据集与方法中的关键研究空白,特别是对家庭环境和长期照护场景关注不足的问题。
  • 为开发鲁棒、保护隐私的骨骼基异常检测系统,提供可操作的指导与未来研究方向。

提出的方法

  • 使用姿态估计模型(如MediaPipe、OpenPose或HRNet)从RGB视频中提取2D或3D人体关节点坐标。
  • 将人体运动表示为关节点坐标的时序序列,形成紧凑且语义丰富的骨骼序列。
  • 采用基于重建的方法(如自编码器)训练深度学习模型,学习正常运动模式并标记偏差。
  • 使用基于预测的模型(如LSTM、Transformer)预测未来关节点位置,并通过预测误差计算异常得分。
  • 结合重建损失与预测损失,以提高异常检测的鲁棒性与泛化能力。
  • 将光流、分割掩码或目标边界框等多模态信号与骨骼信息结合,以建模人-物与人-人交互,同时保护隐私。

实验结果

研究问题

  • RQ1如何利用骨骼表征在保护隐私的前提下检测异常的人体行为?
  • RQ2在家庭和照护机构等敏感环境中,基于外观的视频异常检测方法存在哪些主要局限性?
  • RQ3哪些深度学习架构(如自编码器、LSTM、Transformer)在基于骨骼的异常检测中表现最佳?
  • RQ4如何将基于骨骼的模型扩展以检测涉及人-物或人-人交互的复杂异常?
  • RQ5在真实住宅与临床环境中部署这些系统时,面临的主要开放挑战是什么?

主要发现

  • 基于骨骼的异常检测通过省略面部与外观特征,为RGB方法提供了一种强有力的隐私保护替代方案。
  • 基于重建的模型,尤其是自编码器,在检测异常姿势与异常动作方面表现优异,多个数据集的AUC得分超过0.9。
  • 基于预测的模型(如使用LSTM或Transformer)通过测量预期关节点轨迹的偏差,实现了高异常检测准确率。
  • 结合重建与预测损失的混合模型在检测多样化异常方面优于单一目标方法。
  • 当前数据集主要聚焦于户外或受控环境,对家庭及长期照护场景的代表性不足。
  • 未来与光流、分割掩码及联邦学习的集成可进一步提升隐私保护、鲁棒性与实时部署潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。