Skip to main content
QUICK REVIEW

[论文解读] Relation Modeling in Spatio-Temporal Action Localization

Yutong Feng, Jianwen Jiang|arXiv (Cornell University)|Jun 15, 2021
Human Pose and Action Recognition参考文献 24被引用 8
一句话总结

本文提出了一种基于Transformer的关系建模方法,用于多关系时空动作定位,通过引入记忆库并采用解耦微调策略,有效缓解长尾类别分布问题。该方法在AVA-Kinetics测试集上达到40.67 mAP,通过联合建模人物交互关系并提升罕见动作类别的泛化能力,实现了显著性能增益。

ABSTRACT

This paper presents our solution to the AVA-Kinetics Crossover Challenge of ActivityNet workshop at CVPR 2021. Our solution utilizes multiple types of relation modeling methods for spatio-temporal action detection and adopts a training strategy to integrate multiple relation modeling in end-to-end training over the two large-scale video datasets. Learning with memory bank and finetuning for long-tailed distribution are also investigated to further improve the performance. In this paper, we detail the implementations of our solution and provide experiments results and corresponding discussions. We finally achieve 40.67 mAP on the test set of AVA-Kinetics.

研究动机与目标

  • 提升在大规模、长尾视频数据集(如AVA-Kinetics)上的时空动作定位性能。
  • 探究在基于Transformer的架构中,多种关系建模策略(仅空间S-only、仅时间T-only、以及联合)的有效性。
  • 通过解耦微调和记忆库机制,提升模型在罕见动作类别上的泛化能力。
  • 评估人体检测质量对下游动作定位性能的影响。
  • 将多数据集预训练(AVA + Kinetics)与端到端训练相结合,以提升模型鲁棒性。

提出的方法

  • 使用2D人体检测器生成人体边界框,将其在时间维度上膨胀,并与3D RoI-Align结合,从视频主干网络(如SlowFast或ir-CSN)中提取3D特征图。
  • 应用仅空间(S-only)和仅时间(T-only)关系头,将各人物的空间或时间特征序列展平后输入共享权重的Transformer编码器块,以建模人物间关系。
  • 引入记忆库以在长视频片段中存储和更新人物特征,提升对长程时间依赖性的建模能力。
  • 采用在线记忆库更新策略,结合动量更新规则,稳定特征表示学习。
  • 通过类别平衡采样实施解耦微调,缓解低资源动作类别上的性能下降问题。
  • 支持在AVA和Kinetics数据集上联合预训练与迁移学习的端到端训练。

实验结果

研究问题

  • RQ1S-only与T-only关系头在时空动作定位任务中的性能表现如何比较?
  • RQ2使用记忆库对建模视频动作检测中长程时间依赖性有何影响?
  • RQ3解耦微调是否能在不降低高频类别性能的前提下,提升长尾动作类别上的表现?
  • RQ4人体检测器的选择如何影响最终动作检测的mAP?
  • RQ5多数据集预训练(AVA + Kinetics)对目标测试集泛化能力的贡献如何?

主要发现

  • 仅时间关系头(T-only)结合记忆库相比基线模型mAP提升约0.8分,证明了长程时间建模的价值。
  • 解耦微调使mAP在最不常见的20个动作类别上提升1.05分,且对前20个高频类别性能影响极小。
  • 15个模型的最终集成在AVA-Kinetics测试集上达到40.67 mAP,仅比验证集下降0.3 mAP,表明泛化能力极强。
  • 使用真实标注(GT)边界框后,mAP在AVA上提升至43.53,在Kinetics上提升至48.49,凸显人体检测器是整个流程中的关键瓶颈。
  • 在Kinetics700上预训练相比Kinetics400提升约1 mAP,且将时间分辨率提升2倍后mAP提升约0.6分。
  • 采用两阶段训练策略(先在AVA上训练记忆库,再在AVA-Kinetics上使用空记忆库继续训练)性能最佳,优于需重新初始化头部的策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。