[论文解读] Combined CNN Transformer Encoder for Enhanced Fine-grained Human Action Recognition
本论文提出两种用于细粒度人体动作识别的混合CNN-Transformer架构:3D视觉Transformer编码器与视频-文本交叉Transformer编码器。通过结合3D CNN特征与自注意力及交叉注意力机制,模型学习到增强的时序语义和视觉-文本交叉注意力,实现在FineGym基准上的新SOTA性能,在Gym99上达到94.6%的top-1准确率,在Gym288上达到90.1%。
Fine-grained action recognition is a challenging task in computer vision. As fine-grained datasets have small inter-class variations in spatial and temporal space, fine-grained action recognition model requires good temporal reasoning and discrimination of attribute action semantics. Leveraging on CNN's ability in capturing high level spatial-temporal feature representations and Transformer's modeling efficiency in capturing latent semantics and global dependencies, we investigate two frameworks that combine CNN vision backbone and Transformer Encoder to enhance fine-grained action recognition: 1) a vision-based encoder to learn latent temporal semantics, and 2) a multi-modal video-text cross encoder to exploit additional text input and learn cross association between visual and text semantics. Our experimental results show that both our Transformer encoder frameworks effectively learn latent temporal semantics and cross-modality association, with improved recognition performance over CNN vision model. We achieve new state-of-the-art performance on the FineGym benchmark dataset for both proposed architectures.
研究动机与目标
- 解决细粒度动作识别中的挑战,即类间差异微小,需要强大的时序推理与语义区分能力。
- 利用CNN(时空特征提取)与Transformer(全局依赖建模)的互补优势,提升识别准确率。
- 探索视觉特征与文本描述之间的弱监督交叉注意力,以增强对视觉上相似动作的区分能力。
- 在FineGym基准上实现SOTA性能,该数据集是细粒度体操动作识别的高挑战性数据集。
- 研究纯视觉与多模态视频-文本编码器在捕捉潜在语义与时序依赖关系方面的有效性。
提出的方法
- 使用3D CNN主干网络(SlowOnly)从视频片段中提取时空特征,并将其转换为视觉标记。
- 将视觉标记输入Transformer编码器,以建模长程时序依赖关系并学习潜在语义表征。
- 对于交叉编码器,提取动作类别文本描述并将其嵌入为文本标记,随后与视觉标记在共享Transformer编码器中联合处理。
- 使用动作类别标签进行弱监督训练交叉编码器,实现端到端的视觉-文本注意力学习,无需依赖真实属性对齐标注。
- 采用AdamW优化器,配合余弦退火学习率调度策略,并设置权重衰减为0.05进行训练。
- 应用特征级融合与多头自注意力机制,以实现有效的跨模态交互与表征学习。
实验结果
研究问题
- RQ1Transformer编码器能否有效从CNN提取的视觉特征中学习到细粒度动作识别中的潜在时序语义?
- RQ2引入文本描述在多大程度上提升了对视觉上相似的细粒度动作的区分能力?
- RQ3在无真实属性级别标注的情况下,弱监督视频-文本交叉注意力在学习有意义的视觉-文本关联方面有多高效?
- RQ4CNN与Transformer架构的融合是否在细粒度基准上优于独立的CNN或纯视觉Transformer基线模型?
- RQ5视觉与文本模态之间的交叉注意力对复杂、属性丰富的动作数据集整体识别准确率的贡献如何?
主要发现
- 3D视觉Transformer编码器在Gym99上达到94.0%的top-1准确率,在Gym288上达到90.5%,优于所有基于CNN的基线模型,包括TSN、TRNms、TSM、I3D和NL I3D。
- 视频-文本交叉Transformer编码器在Gym99上达到94.6%的top-1准确率,在Gym288上达到90.1%,在FineGym基准上创下新的SOTA性能。
- 与SlowOnly基线相比,交叉编码器框架在Gym288上的top-1准确率提升了3.28个百分点,证明了弱监督视觉-文本对齐的优越性。
- VT交叉编码器在Gym99上比先前SOTA模型TQN(采用查询-响应机制)高出0.8%,在Gym288上高出0.5%,表明其具备更优的跨编码能力。
- 两种所提模型均显著优于SlowOnly基线,其中交叉编码器提升最大,凸显了多模态学习的价值。
- 结果证实,学习全局时序语义与跨模态关联可有效提升在空间与时间差异细微的细粒度动作中的区分能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。