Skip to main content
QUICK REVIEW

[论文解读] TEAM-Net: Multi-modal Learning for Video Action Recognition with Partial Decoding

Zhengwei Wang, Qi She|arXiv (Cornell University)|Oct 17, 2021
Human Pose and Action Recognition参考文献 27被引用 4
一句话总结

TEAM-Net 提出了一种即插即用的多模态学习模块(TEAM),用于使用部分解码视频进行视频动作识别,利用图像帧(I-frames)、运动矢量(MVs)以及图像组(GOPs)的残差。通过端到端地融合这些模态,采用序列化通道与空间融合策略,该方法在 UCF-101 和 HMDB-51 上实现了最先进(SOTA)的性能,优于仅使用 RGB 的基线方法以及先前的压缩域方法。

ABSTRACT

Most of existing video action recognition models ingest raw RGB frames. However, the raw video stream requires enormous storage and contains significant temporal redundancy. Video compression (e.g., H.264, MPEG-4) reduces superfluous information by representing the raw video stream using the concept of Group of Pictures (GOP). Each GOP is composed of the first I-frame (aka RGB image) followed by a number of P-frames, represented by motion vectors and residuals, which can be regarded and used as pre-extracted features. In this work, we 1) introduce sampling the input for the network from partially decoded videos based on the GOP-level, and 2) propose a plug-and-play mulTi-modal lEArning Module (TEAM) for training the network using information from I-frames and P-frames in an end-to-end manner. We demonstrate the superior performance of TEAM-Net compared to the baseline using RGB only. TEAM-Net also achieves the state-of-the-art performance in the area of video action recognition with partial decoding. Code is provided at https://github.com/villawang/TEAM-Net.

研究动机与目标

  • 通过利用压缩域中的部分解码视频流,解决原始视频数据带来的高存储需求与冗余问题。
  • 通过在统一框架内有效融合三种模态——外观(I-frames)、运动(MVs)和残差纹理——来提升视频动作识别性能。
  • 克服先前方法仅在推理阶段融合或分别训练主干网络的局限性,通过实现中层特征融合的端到端训练。
  • 提出一种即插即用模块(TEAM),实现在部分压缩域中高效且有效的多模态学习。

提出的方法

  • 在 GOP 层级采样输入,使用每个 GOP 的首张 I-帧以及一张 P-帧(含 MVs 和残差)代替完整的 RGB 解码。
  • 引入一个多模态学习模块(TEAM),执行序列化融合:首先进行通道级融合以捕捉各模态的全局重要性,随后进行空间融合以定位相关区域。
  • 设计了五种 TEAM 的配置,其中性能最佳的变体为先通道融合后空间融合(TEAM_{c→s})。
  • 将 TEAM 模块嵌入 TSN 主干网络的多个阶段(Conv1、Res2、Res3、Res4 之后),以实现中层融合,避免晚期融合带来的性能下降。
  • 采用双分支特征聚合策略,各模态在融合前独立处理,以保留模态特异性表征。
  • 使用交叉熵损失对整个网络进行端到端训练,无需对单个模态进行单独训练。

实验结果

研究问题

  • RQ1使用部分解码视频中的 I-frames、运动矢量和残差进行多模态学习,是否能提升视频动作识别性能,相比仅使用 RGB 的基线方法?
  • RQ2在部分压缩域中,采用中层融合的端到端训练是否优于晚期融合或分别训练主干网络的方法?
  • RQ3在视频动作识别中,通道融合与空间融合的最优融合顺序是什么?
  • RQ4网络内部嵌入位置(阶段)的选择如何影响 TEAM 模块的性能?
  • RQ5即插即用模块能否在无需架构重构的情况下有效集成多种模态?

主要发现

  • TEAM-Net 在 UCF-101 上以 8 帧输入达到 94.3% 的平均准确率,在 HMDB-51 上达到 73.8%,优于仅使用 RGB 的 TSN 基线模型。
  • 序列化融合策略(TEAM_{c→s})表现最佳,在 UCF-101 上相比并行配置获得 0.6% 的绝对性能提升。
  • 在中层阶段(Conv1、Res2、Res3、Res4 之后)进行融合,性能优于晚期融合,后者因空间分辨率过低而造成准确率下降。
  • 通过类别特定的注意力可视化,证实 TEAM 模块成功捕捉了‘是什么’(通过通道融合)和‘在哪里’(通过空间融合)的信息。
  • 该方法在部分压缩域中实现了最先进性能,超越了先前使用独立主干网络或晚期融合的方法。
  • 消融实验表明,通道融合与空间融合均不可或缺,仅使用通道融合或仅使用空间融合的单模态融合配置,性能均低于完整 TEAM 模块。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。