Skip to main content
QUICK REVIEW

[论文解读] A Hierarchical Deep Temporal Model for Group Activity Recognition

Moustafa Ibrahim, S. Muralidharan|arXiv (Cornell University)|Nov 19, 2015
Human Pose and Action Recognition参考文献 36被引用 9
一句话总结

本文提出一种两阶段分层深度LSTM模型用于群体活动识别,首先利用LSTM建模个体行为,再聚合这些表征以识别集体活动。该模型在Collective Activity数据集和新提出的排球数据集上均优于基线方法,通过显式建模个体间时空关系的结构化时序建模,实现了更高的准确率。

ABSTRACT

In group activity recognition, the temporal dynamics of the whole activity can be inferred based on the dynamics of the individual people representing the activity. We build a deep model to capture these dynamics based on LSTM (long-short term memory) models. To make use of these ob- servations, we present a 2-stage deep temporal model for the group activity recognition problem. In our model, a LSTM model is designed to represent action dynamics of in- dividual people in a sequence and another LSTM model is designed to aggregate human-level information for whole activity understanding. We evaluate our model over two datasets: the collective activity dataset and a new volley- ball dataset. Experimental results demonstrate that our proposed model improves group activity recognition perfor- mance with compared to baseline methods.

研究动机与目标

  • 为通过在个体和集体两个层次建模时序动态,解决视频中群体活动识别的挑战。
  • 克服手工设计特征和浅层模型在捕捉人群间复杂时空关系方面的局限性。
  • 开发一种深度学习架构,显式建模个体行为,并将其整合为更高层次的群体活动表征。
  • 构建一个全新的、公开可用的排球数据集,包含个体层面和群体活动的标注,以支持基准测试。
  • 评估分层时序建模在提升群体活动识别准确率方面的有效性。

提出的方法

  • 提出一种两阶段深度学习架构:第一阶段使用LSTM基于外观和运动特征建模被追踪个体的时序动态。
  • 第二阶段使用另一LSTM聚合个体表征并推断整体群体活动。
  • 在第二阶段LSTM之前使用最大池化(max-pooling)组合个体表征,消融实验表明最大池化优于平均池化和求和池化。
  • 该架构在包含个体检测结果的视频序列上端到端训练,利用时序建模捕捉序列依赖关系。
  • 引入一个新的排球数据集,包含个体行为标签和群体活动标签,支持视频级和个体级评估。
  • 基线模型包括图像分类、个体行为分类以及基于图像或个体特征的时序模型,用于对比评估。

实验结果

研究问题

  • RQ1是否可以通过分别建模个体行为并聚合其表征的分层深度学习模型,提升群体活动识别性能?
  • RQ2与整体图像基方法相比,显式建模个体行为动态如何提升对集体活动的识别能力?
  • RQ3第一阶段(个体级)和第二阶段(群体级)LSTM对整体性能的相对贡献如何?
  • RQ4该模型在具有稀疏动态群体行为和快速相机运动的新排球数据集上的表现如何?
  • RQ5分层时序建模是否优于非分层或非时序基线方法,在群体活动识别中表现更优?

主要发现

  • 所提出的两阶段分层LSTM模型在新排球数据集上达到51.1%的准确率,优于所有基线方法,包括非时序图像分类基线(46.7%)。
  • 消融实验表明,第一阶段LSTM(个体级建模)对性能的贡献大于第二阶段LSTM,移除第一阶段LSTM后性能降至48.8%。
  • 在聚合个体表征时,最大池化表现最佳,而求和池化和平均池化均导致一致更低的准确率。
  • 混淆矩阵显示,模型最常将‘发球’(set)和‘传球’(pass)动作混淆,原因在于其视觉和运动特征相似,但对大多数群体活动仍保持高整体准确率。
  • 模型对背景杂波和相机运动具有鲁棒性,表现为未显式建模个体的基线模型性能较差(B4:37.4%准确率),而基于个体感知的时序基线(B5)性能接近图像分类基线(45.9%)。
  • 新排球数据集已公开,群体活动标签分布均衡,但个体行为标签存在不平衡,反映出真实场景中稀有动态行为的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。