[论文解读] Action Recognition with Joint Attention on Multi-Level Deep Features
本文提出一种基于多级深度特征联合注意力机制的深度监督神经网络,用于视频动作识别,结合3D卷积网络与一种新型联合LSTM模块,以增强时序建模能力与鲁棒性。该模型仅使用RGB特征,在UCF101和HMDB51数据集上达到最先进性能,相较于基线注意力模型最高提升20.4%的准确率。
We propose a novel deep supervised neural network for the task of action recognition in videos, which implicitly takes advantage of visual tracking and shares the robustness of both deep Convolutional Neural Network (CNN) and Recurrent Neural Network (RNN). In our method, a multi-branch model is proposed to suppress noise from background jitters. Specifically, we firstly extract multi-level deep features from deep CNNs and feed them into 3d-convolutional network. After that we feed those feature cubes into our novel joint LSTM module to predict labels and to generate attention regularization. We evaluate our model on two challenging datasets: UCF101 and HMDB51. The results show that our model achieves the state-of-art by only using convolutional features.
研究动机与目标
- 解决在视频动作识别中捕捉时序动态的挑战,同时保持对背景杂波和类内差异的鲁棒性。
- 通过整合预训练CNN的多级深度特征,克服基于轨迹与单分支特征提取方法的局限性。
- 通过一种新型注意力正则化机制,提升3D卷积网络与联合LSTM模块的性能。
- 设计自适应融合机制,通过两种新型联合LSTM结构,有效整合不同抽象层级的特征。
提出的方法
- 从预训练的VGG-16网络(如pool4与conv5_3层)中提取多级深度特征,以捕捉通用与特定的视觉模式。
- 将提取的特征输入3D卷积网络,以建模视频片段中的时空依赖关系。
- 采用一种新型联合LSTM模块,联合预测动作类别并生成注意力图以实现特征正则化。
- 引入软监督正则化项,引导注意力学习,提升训练收敛性与泛化能力。
- 在联合LSTM中实现两种融合策略——早期融合与晚期融合,以自适应整合多级特征。
- 使用交叉熵损失结合注意力正则化,端到端训练整个模型,以增强判别能力。
实验结果
研究问题
- RQ1在不依赖光流或复杂手工设计特征的前提下,对多级深度特征实施联合注意力是否能提升动作识别性能?
- RQ2注意力正则化如何增强3D卷积网络与LSTM组件的学习效果?
- RQ3与单级特征相比,使用多级特征(如来自不同VGG-16层的特征)有何影响?
- RQ4在联合LSTM中,早期融合与晚期融合策略对性能与特征整合有何影响?
- RQ5所提出的模型是否能仅使用RGB输入就达到或超越最先进方法,而无需额外模态融合?
主要发现
- 所提模型在UCF101上达到90.6%的top-1准确率,在HMDB51上达到61.7%,相较于基线软注意力模型绝对准确率提升20.4%。
- 使用来自不同VGG-16层(如pool4与conv5_3)的多分支特征显著提升性能,晚期融合在HMDB51上达到61.7%的准确率。
- 3D卷积网络相较于2D-convnet与直接输入LSTM分别提升4.4%与4.6%的准确率,证明其在捕捉时空模式方面的有效性。
- 注意力正则化带来更快收敛与更低的训练损失,模型在第三epoch即趋于稳定。
- 采用晚期融合架构的联合LSTM性能优于早期融合,表明其具备更优的特征融合能力与独立性。
- 定性注意力图显示,模型能成功聚焦于与动作相关的关键区域(如手部、面部、四肢),与人类对关键动作线索的感知一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。