[论文解读] Hierarchical Deep Temporal Models for Group Activity Recognition
本文提出了一种两阶段分层深度LSTM模型用于群体活动识别,通过个体层面的LSTM建模个体行为,并利用时间池化将这些表示聚合为群体层面的表征。该方法在新构建的排球数据集上实现了81.9%的准确率,优于强Baseline的手工设计特征方法,并通过分层建模时空动态关系提升了泛化能力。
In this paper we present an approach for classifying the activity performed by a group of people in a video sequence. This problem of group activity recognition can be addressed by examining individual person actions and their relations. Temporal dynamics exist both at the level of individual person actions as well as at the level of group activity. Given a video sequence as input, methods can be developed to capture these dynamics at both person-level and group-level detail. We build a deep model to capture these dynamics based on LSTM (long short-term memory) models. In order to model both person-level and group-level dynamics, we present a 2-stage deep temporal model for the group activity recognition problem. In our approach, one LSTM model is designed to represent action dynamics of individual people in a video sequence and another LSTM model is designed to aggregate person-level information for group activity recognition. We collected a new dataset consisting of volleyball videos labeled with individual and group activities in order to evaluate our method. Experimental results on this new Volleyball Dataset and the standard benchmark Collective Activity Dataset demonstrate the efficacy of the proposed models.
研究动机与目标
- 为解决视频中群体活动识别的挑战,其中群体标签依赖于个体之间复杂的时空关系。
- 克服手工设计特征与浅层模型在捕捉个体与群体层面分层时间动态方面的局限性。
- 设计一种深度学习架构,显式建模个体行为动态并将其聚合用于群体活动分类。
- 在包含细粒度个体与群体活动标注的大规模排球视频数据集上评估该模型。
- 证明分层建模相比整体或非分层深度学习方法能提升性能。
提出的方法
- 该模型采用两阶段架构:首先,个体轨迹由独立的LSTM处理,以学习个体行为动态。
- 其次,个体LSTM的输出通过最大池化或平均池化进行聚合,形成用于群体活动识别的场景级表征。
- 群体级LSTM对池化后的表征进行时间建模,以分类整体群体活动。
- 该方法利用检测并跟踪到的个体作为输入,通过从边界框中提取特征以减少背景干扰。
- 模型通过端到端方式使用个体特征的时间序列进行训练,超参数通过在LSTM节点数和时间步长上的消融实验进行调优。
- 构建了一个新型排球数据集,包含1000段视频剪辑,对个体与群体活动进行了精细标注,用于训练与评估。
实验结果
研究问题
- RQ1分层深度学习模型能否有效捕捉群体活动识别中个体与群体层面的时间动态?
- RQ2在聚合前先建模个体行为是否能提升性能,相比整体视频级别的分类方法?
- RQ3池化策略选择(最大池化与平均池化)对群体活动识别任务准确率的影响如何?
- RQ4分层建模在多大程度上减少了相似群体活动之间的混淆,如左右两队的进攻动作?
- RQ5与强Baseline方法(如改进的密集轨迹IDTF)相比,所提模型表现如何?
主要发现
- 所提出的两阶段分层LSTM模型在新排球数据集上达到81.9%的准确率,显著优于改进的密集轨迹基线方法(73.4%)。
- 通过为两个子群体(左队与右队)分别进行表征学习,有效减少了左/右队得分动作之间的混淆,提升了分类鲁棒性。
- 当群体级LSTM层使用3000个节点且时间步长为3000时,模型达到最高准确率(81.9%),表明该容量对任务为最优。
- 消融实验表明,增加LSTM节点数可提升性能,但超过3000个节点后收益递减。
- 模型成功解决了以往工作中常见的“设置”与“传球”动作混淆问题,可能归因于更优的时间建模与更丰富的训练数据。
- 可视化结果表明,模型能正确分类大多数场景,失败案例主要出现在动作模糊或左右队误判的情形。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。