[论文解读] GroupFormer: Group Activity Recognition with Clustered Spatial-Temporal Transformer
GroupFormer 提出了一种基于 Transformer 的新型框架,用于群体活动识别,通过聚类的空间-时间 Transformer(CSTT)联合建模空间和时间依赖性。通过动态将个体分组为聚类,并应用组内与组间注意力机制,增强了表征学习,在 Volleyball 和 Collective Activity 数据集上实现了 SOTA 性能,群体活动识别准确率达到 94.1%。
Group activity recognition is a crucial yet challenging problem, whose core lies in fully exploring spatial-temporal interactions among individuals and generating reasonable group representations. However, previous methods either model spatial and temporal information separately, or directly aggregate individual features to form group features. To address these issues, we propose a novel group activity recognition network termed GroupFormer. It captures spatial-temporal contextual information jointly to augment the individual and group representations effectively with a clustered spatial-temporal transformer. Specifically, our GroupFormer has three appealing advantages: (1) A tailor-modified Transformer, Clustered Spatial-Temporal Transformer, is proposed to enhance the individual representation and group representation. (2) It models the spatial and temporal dependencies integrally and utilizes decoders to build the bridge between the spatial and temporal information. (3) A clustered attention mechanism is utilized to dynamically divide individuals into multiple clusters for better learning activity-aware semantic representations. Moreover, experimental results show that the proposed framework outperforms state-of-the-art methods on the Volleyball dataset and Collective Activity dataset. Code is available at https://github.com/xueyee/GroupFormer.
研究动机与目标
- 为解决在群体活动识别中联合建模空间-时间依赖性的挑战,现有方法通常将空间和时间关系分开处理,或使用全连接注意力机制,从而引入噪声。
- 通过基于语义相关性的动态聚类个体,改善群体表征学习,减少无关交互带来的干扰。
- 构建一个端到端可训练的框架,有效捕捉组内与组间关系,以实现更优的活动感知特征学习。
- 在基准数据集上超越现有 SOTA 方法的群体活动识别性能。
提出的方法
- 引入一种定制化修改的 Transformer 架构——聚类空间-时间 Transformer(CSTT),通过堆叠的编码器和交叉注意力解码器,联合建模空间和时间特征。
- 采用聚类注意力机制,将个体动态划分为 C 个聚类,实现在聚类内部的局部信息传播和聚类之间的全局交互建模。
- 模型使用群体表征生成器,在应用多个 CSTT 模块进行表征精炼前,融合个体特征与场景级上下文信息。
- 采用解码器以交叉注意力方式构建空间与时间特征之间的桥梁,实现对时空上下文的联合建模。
- 框架同时采用组内注意力(组内)和组间注意力(组间),以增强特征学习。
- 该架构支持端到端训练,并利用查询-键机制建模视频序列中的长距离依赖性。
实验结果
研究问题
- RQ1联合建模空间与时间依赖性是否能提升群体活动识别的性能?
- RQ2将个体动态聚类为语义相关的组是否能增强表征学习并减少无关交互带来的噪声?
- RQ3组内与组间注意力机制如何促进活动感知表征的学习?
- RQ4为最大化识别准确率,最优聚类数和 CSTT 模块数量是多少?
- RQ5所提出的框架是否能在标准基准上超越现有 SOTA 方法?
主要发现
- GroupFormer 在 Volleyball 数据集上的群体活动识别准确率达到 94.1%,优于先前的 SOTA 方法。
- 消融实验表明,将标准空间-时间 Transformer 替换为聚类注意力机制(CSTT)后,性能从 93.4% 提升至 94.1%。
- 使用四个聚类时性能最佳,显著优于使用一个聚类或其他聚类数量的情况。
- 组内与组间注意力机制的结合实现了最高性能,准确率达到 94.1%,证明了其互补优势。
- 堆叠三个 CSTT 模块时性能最佳,而四个模块导致轻微性能下降,表明存在最优的特征精炼深度。
- t-SNE 可视化结果表明,CSTT 变体学习到的特征表示更具判别性且聚类更清晰,优于基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。