Skip to main content
QUICK REVIEW

[论文解读] Deep Structured Models For Group Activity Recognition

Zhiwei Deng, Mengyao Zhai|arXiv (Cornell University)|Jun 12, 2015
Human Pose and Action Recognition参考文献 19被引用 18
一句话总结

该论文提出了一种深度结构化模型,将卷积神经网络(ConvNets)与受概率图模型启发的消息传递神经网络相结合,以提升监控视频中的群体活动识别性能。通过类似信念传播的推理机制,利用标签间的依赖关系对个体动作预测进行优化,该方法在Collective Activity数据集上实现了80.6%的最先进准确率,在Nursing Home数据集上达到了84.7%,显著提升了结构化标签优化的效果。

ABSTRACT

This paper presents a deep neural-network-based hierarchical graphical model for individual and group activity recognition in surveillance scenes. Deep networks are used to recognize the actions of individual people in a scene. Next, a neural-network-based hierarchical graphical model refines the predicted labels for each class by considering dependencies between the classes. This refinement step mimics a message-passing step similar to inference in a probabilistic graphical model. We show that this approach can be effective in group activity recognition, with the deep graphical model improving recognition rates over baseline methods.

研究动机与目标

  • 通过建模个体动作与群体层面交互之间的依赖关系,解决在监控视频中识别复杂群体活动的挑战。
  • 通过将概率图模型原理整合到深度学习框架中,特别是通过结构化标签优化,提升识别准确率。
  • 开发一个统一的端到端可学习框架,其中消息传递过程可微分且可通过反向传播进行训练,实现深度特征与关系依赖的联合优化。
  • 评估消息传递在真实监控场景中对个体动作与全局群体活动预测的优化效果。

提出的方法

  • 提出一种两阶段深度学习框架:首先,使用卷积神经网络从图像帧中为场景中每个人的个体动作预测得分。
  • 其次,通过消息传递神经网络层执行类似信念传播的推理,通过建模个体动作、姿态与群体活动之间的依赖关系,对预测结果进行优化。
  • 消息传递机制被实现为可学习的神经网络层,其行为模仿概率图模型的推理过程,参数通过反向传播进行更新。
  • 模型使用因子节点表示变量之间的关系(例如动作对或群体状态),并通过这些因子在节点间传递消息以优化预测结果。
  • 该框架支持端到端训练,实现深度特征与结构化依赖关系的联合优化,可选择性地将全局场景特征(如HOG)拼接以提供额外上下文信息。
  • 该方法在两个数据集上进行了评估:Collective Activity(包含12类群体活动)和Nursing Home(二分类跌倒检测),采用标准划分与帧采样策略。

实验结果

研究问题

  • RQ1是否能够通过引入结构化消息传递机制的深度神经网络架构,在群体活动识别任务上超越标准深度学习基线模型?
  • RQ2在群体活动中,利用标签间的依赖关系,消息传递在优化个体动作预测方面有多高效?
  • RQ3将图模型推理机制整合到深度学习框架中,是否能在真实监控数据集上带来可测量的识别准确率提升?
  • RQ4不同消息传递步数(1步 vs. 2步)对性能的影响如何?在低数据场景下,全局场景特征的贡献是什么?

主要发现

  • 所提出的深度结构化模型在Collective Activity数据集上实现了80.6%的场景分类准确率,优于先前使用潜在最大间隔图模型的最先进结果(79.1%)。
  • 在Nursing Home数据集上,模型在使用两步消息传递后达到84.7%的准确率,较基线深度学习模型提升1.5%,表明其在遮挡严重、挑战性高的场景中具有鲁棒性。
  • 每一轮消息传递均带来性能增益:在Collective Activity数据集中,无消息传递时准确率为73.6%,一轮后提升至78.4%,两轮后达到80.6%。
  • 引入全局场景特征(如基于HOG的AC描述符)可提升性能,尤其在低数据场景下,仅使用AlexNet时准确率仅为48%。
  • 可视化结果表明,消息传递通过利用上下文一致性纠正了错误预测——例如,当群体上下文表明应为“等待”或“排队”时,可修正孤立的“交谈”标签。
  • 该方法有效捕捉了局部成对交互与全局群体关系,性能增益表明结构化依赖关系对准确理解群体活动至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。