Skip to main content
QUICK REVIEW

[论文解读] Exploiting Spatial-Temporal Modelling and Multi-Modal Fusion for Human Action Recognition

Dongliang He, Fu Li|arXiv (Cornell University)|Jun 27, 2018
Human Pose and Action Recognition参考文献 23被引用 21
一句话总结

本文提出 StNet,一种结合 2D 与 3D 卷积的空间-时间建模框架,用于联合学习视频中的局部时空模式与长程时间动态。此外,本文还引入 iTXN,一种改进的时空 Xception 网络,通过早期融合与晚期融合策略融合 RGB、光流与音频模态,借助模型集成在 Kinetics-600 验证集上达到 85.0% 的 top-1 准确率。

ABSTRACT

In this report, our approach to tackling the task of ActivityNet 2018 Kinetics-600 challenge is described in detail. Though spatial-temporal modelling methods, which adopt either such end-to-end framework as I3D \cite{i3d} or two-stage frameworks (i.e., CNN+RNN), have been proposed in existing state-of-the-arts for this task, video modelling is far from being well solved. In this challenge, we propose spatial-temporal network (StNet) for better joint spatial-temporal modelling and comprehensively video understanding. Besides, given that multi-modal information is contained in video source, we manage to integrate both early-fusion and later-fusion strategy of multi-modal information via our proposed improved temporal Xception network (iTXN) for video understanding. Our StNet RGB single model achieves 78.99\% top-1 precision in the Kinetics-600 validation set and that of our improved temporal Xception network which integrates RGB, flow and audio modalities is up to 82.35\%. After model ensemble, we achieve top-1 precision as high as 85.0\% on the validation set and rank No.1 among all submissions.

研究动机与目标

  • 通过在统一的端到端框架中联合建模空间与时间特征,提升视频理解能力。
  • 通过用 3D 卷积替代循环神经网络(RNN)等递归架构,解决其在时间建模中的局限性,实现更优的优化与性能。
  • 通过结合早期与晚期融合策略,有效融合多模态视频信号(RGB、光流与音频),提升识别准确率。
  • 通过架构创新与模型集成,在 ActivityNet 2018 Kinetics-600 挑战赛中实现最先进性能。

提出的方法

  • StNet 通过将 N 个连续的 RGB 帧沿通道维度堆叠,构建超图像,使 2D 卷积能够建模局部时空模式。
  • 通过使用时间卷积核大小为 3、空间卷积核大小为 1 的 3D 卷积,捕捉长程时间依赖关系,应用于 T 个采样的超图像。
  • 在 ResNet 的 Res3 和 Res4 块之后插入 3D 卷积块,以在保留分层特征学习的同时实现时间建模。
  • iTXN 通过时间 Xception 块分别处理 RGB、TV_L1 光流、Farneback 光流与音频特征(用于晚期融合),并联合处理多模态输入(用于早期融合)。
  • 该框架将早期融合特征(模态拼接)与单独编码的模态特征结合,生成统一表示用于分类。
  • 通过梯度提升决策树(GBDT)进行模型集成,融合单模态与多模态模型的预测结果,以最大化性能。

实验结果

研究问题

  • RQ1混合 2D-3D 卷积架构是否能在端到端视频动作识别中超越标准双流模型或基于 RNN 的模型?
  • RQ2结合早期与晚期融合策略处理多模态视频输入,是否能优于单独使用任一策略?
  • RQ3采用减少参数量的 3D 卷积时间建模方法,是否仍能与使用完整 3D 卷积核的 3D CNN 相比保持强性能?
  • RQ4在大规模动作识别基准上,将音频与光流特征与 RGB 特征融合,是否能有效提升识别准确率?
  • RQ5通过集成多样化单模态与多模态模型,能在多大程度上提升 Kinetics-600 上的 top-1 准确率?

主要发现

  • StNet-IRv2 在 Kinetics-600 验证集上达到 78.99% 的 top-1 准确率,比 TSN-IRv2 提高 2.83 个百分点。
  • 所提出的 StNet 框架在参数量更少且避免使用完整 3D 卷积的情况下,性能与非局部-Res50-I3D 相当或更优。
  • 采用 RGB、光流与音频模态的早期与晚期融合策略的 iTXN 达到 82.35% 的 top-1 准确率,证明了多模态融合的有效性。
  • 最终通过 GBDT 集成的模型达到 85.0% 的 top-1 准确率与 96.9% 的 top-5 准确率,在 ActivityNet 2018 Kinetics-600 挑战赛中排名第一。
  • 各单模态性能差异显著:RGB 达到 78.99%,Farneback 光流为 71.3%,TV_L1 光流为 65.1%,仅音频为 23%,凸显多模态融合的重要性。
  • 消融实验证实,StNet 在 ResNet 块后引入的 3D 卷积显著提升了长程时间建模能力,优于标准 2D 或双流基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。