[论文解读] Attention-based Temporal Weighted Convolutional Neural Network for Action Recognition
本文提出了一种基于注意力机制的时间加权卷积神经网络(ATW),通过应用可学习的时间注意力机制,聚焦于语义关键的视频片段,从而提升视频动作识别性能。通过将软注意力机制通过时间加权整合到多流卷积神经网络中,ATW 实现了端到端训练,并在 UCF-101 上达到 94.6% 的准确率,在 HMDB-51 上达到 70.5%,性能达到当前最优水平。
Research in human action recognition has accelerated significantly since the introduction of powerful machine learning tools such as Convolutional Neural Networks (CNNs). However, effective and efficient methods for incorporation of temporal information into CNNs are still being actively explored in the recent literature. Motivated by the popular recurrent attention models in the research area of natural language processing, we propose the Attention-based Temporal Weighted CNN (ATW), which embeds a visual attention model into a temporal weighted multi-stream CNN. This attention model is simply implemented as temporal weighting yet it effectively boosts the recognition performance of video representations. Besides, each stream in the proposed ATW framework is capable of end-to-end training, with both network parameters and temporal weights optimized by stochastic gradient descent (SGD) with backpropagation. Our experiments show that the proposed attention mechanism contributes substantially to the performance gains with the more discriminative snippets by focusing on more relevant video segments.
研究动机与目标
- 通过有效建模长程时间依赖关系,超越固定的时间池化方法,提升视频动作识别性能。
- 通过学习聚焦于最具判别性的视频片段,解决长视频中噪声或无关片段的挑战。
- 设计一种可端到端训练的时间注意力机制,无需额外标注(如人体姿态)。
- 仅使用标准数据集标签,在 UCF-101 和 HMDB-51 等标准基准上实现最先进性能。
- 证明仅通过可学习注意力机制进行简单的时间加权,即可显著优于均匀或固定权重聚合方法。
提出的方法
- ATW 框架采用多流卷积神经网络架构,每一流处理来自非重叠视频片段的不同模态(如 RGB、光流、形变光流)。
- 可学习的时间注意力机制根据视频片段与动作类别的相关性,为其分配动态权重,通过在时间片段上使用 softmax 的软注意力层实现。
- 注意力权重通过全连接层后接 softmax 激活函数计算,使网络能够学习哪些片段对最终预测贡献最大。
- 整个网络(包括卷积权重和注意力参数)通过随机梯度下降与反向传播进行端到端训练。
- 注意力机制应用于视频级预测阶段,所有片段的特征在最终分类层前经过加权融合。
- 实验采用 ResNet 作为主干网络,空间流在 ImageNet 上预训练,时间流通过跨模态预训练进行训练。
实验结果
研究问题
- RQ1可学习的时间加权机制是否能通过聚焦最具信息量的视频片段,提升视频动作识别性能?
- RQ2使用标准数据集标签对注意力机制进行端到端训练,是否能优于固定或均匀加权策略?
- RQ3所提出的 ATW 模型在 UCF-101 和 HMDB-51 等标准基准上与最先进方法相比表现如何?
- RQ4注意力机制是否能有效识别并优先处理在背景杂乱的长而复杂的视频中具有语义关键性的帧?
- RQ5为最大化识别准确率,视频片段(片段)的最优数量和注意力层的初始化策略是什么?
主要发现
- 所提出的 ATW 模型在 UCF-101 数据集上达到 94.6% 的 top-1 准确率,超越此前最先进方法(如 TSN 三模态为 93.4%,KVMF 为 93.1%)。
- 在 HMDB-51 数据集上,ATW 达到 70.5% 的准确率,优于 TSN(三模态)的 69.4%,以及其他近期模型如 LTC(64.8%)和 KVMF(63.3%)。
- 在 UCF-101 上,N=4 个片段时取得最佳性能,准确率达 85.80%,且在不同片段数量下表现出强鲁棒性。
- 在 UCF-101 上,将注意力权重初始化为 1、偏置初始化为 0 时准确率最高(85.80%),优于随机高斯初始化和均匀初始化。
- 注意力权重的可视化结果表明,模型能够学习聚焦于前景动作片段,并抑制背景或无关帧。
- 消融实验表明,注意力机制显著优于均匀加权策略,有效降低噪声并增强判别性特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。