[论文解读] Learning Latent Sub-events in Activity Videos Using Temporal Attention Filters
本文提出可微分的时间注意力滤波器,通过动态聚焦于相关的时间片段,学习动作视频中的潜在子事件,结合CNN和LSTM进行端到端训练,从而提升动作识别性能。该方法在HMDB51数据集上达到68.4%的准确率,显著优于基线方法,并有效学习到诸如'roll'或'stretch'等语义上有意义的子事件。
In this paper, we newly introduce the concept of temporal attention filters, and describe how they can be used for human activity recognition from videos. Many high-level activities are often composed of multiple temporal parts (e.g., sub-events) with different duration/speed, and our objective is to make the model explicitly learn such temporal structure using multiple attention filters and benefit from them. Our temporal filters are designed to be fully differentiable, allowing end-of-end training of the temporal filters together with the underlying frame-based or segment-based convolutional neural network architectures. This paper presents an approach of learning a set of optimal static temporal attention filters to be shared across different videos, and extends this approach to dynamically adjust attention filters per testing video using recurrent long short-term memory networks (LSTMs). This allows our temporal attention filters to learn latent sub-events specific to each activity. We experimentally confirm that the proposed concept of temporal attention filters benefits the activity recognition, and we visualize the learned latent sub-events.
研究动机与目标
- 解决现有基于CNN的动作识别方法在建模由持续时间与速度各异的子事件构成的高层活动的复杂时间结构方面的局限性。
- 实现时间注意力滤波器的端到端学习,隐式学习潜在子事件,而无需依赖真实子事件标注。
- 设计完全可微分的时间注意力滤波器,可与底层CNN和LSTM架构联合优化。
- 探索静态与动态自适应注意力滤波器学习策略,以提升识别性能。
- 可视化并验证所学习的滤波器与真实动作视频中语义上有意义的子事件相对应。
提出的方法
- 该方法采用一组静态时间注意力滤波器,每个滤波器由相对时间坐标中的中心位置、持续时间与分辨率参数化,并作为可微分的高斯滤波器应用于帧级CNN特征。
- 每个滤波器在其时间窗口内计算帧特征的加权和,输出结果拼接后通过全连接层进行分类。
- 滤波器通过反向传播进行端到端训练,实现滤波器参数与CNN权重的联合优化,无需子事件标注。
- 基于LSTM的变体在多次迭代中为每段视频动态调整滤波器参数,从而实现对视频特定子事件的自适应聚焦。
- 该方法兼容任何基于帧或基于片段的CNN架构(如VGG、C3D或TDD),可与固定或学习的滤波器配置结合使用。
- 模型使用交叉熵损失进行训练,并在HMDB51和UCF101数据集上通过标准动作识别指标进行评估。
实验结果
研究问题
- RQ1可微分的时间注意力滤波器是否能在无需真实子事件标注的情况下,有效学习动作视频中的潜在子事件?
- RQ2与标准池化或固定时间金字塔方法相比,将时间滤波器与CNN联合端到端训练是否能提升动作识别性能?
- RQ3基于LSTM的机制是否能为每段视频动态自适应调整注意力滤波器,以更好地捕捉特定活动的子事件?
- RQ4所学习的时间注意力滤波器是否与真实世界活动中语义上有意义的子事件(如'roll'或'stretch')相对应?
- RQ5当使用相同基础特征时,所提方法的性能与当前最先进方法相比如何?
主要发现
- 使用TDD特征和每动作时间滤波器时,所提方法在HMDB51数据集上达到68.4%的准确率,相比使用平均池化的基线TDD模型提升了10.9%。
- 使用C3D特征时,该方法通过学习的时间滤波器达到57.7%的准确率,优于时间金字塔基线的49.7%。
- 基于LSTM的动态滤波器自适应机制优于静态滤波器,在使用三个滤波器时,C3D特征下准确率达到43.03%,高于静态滤波器的42.50%。
- 可视化结果证实,所学习的滤波器能够捕捉语义上有意义的子事件,如俯卧撑中的'do down'、出拳动作中的'stretch',以及后空翻中的'roll'和'stand up'。
- 当仅使用单一特征类型时,该方法显著优于多个最先进方法,证明了学习子事件建模的有效性。
- 在多个基础网络(VGG、C3D、TDD)上性能提升一致,证实了时间注意力滤波器方法的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。