QUICK REVIEW
[论文解读] Trimmed Action Recognition, Dense-Captioning Events in Videos, and Spatio-temporal Action Localization with Focus on ActivityNet Challenge 2019
Zhaofan Qiu, Dong Li|arXiv (Cornell University)|Jun 14, 2019
Human Pose and Action Recognition参考文献 27被引用 8
一句话总结
本论文针对 ActivityNet Challenge 2019 提出了一种多线索视频理解框架,通过晚期融合整合帧、运动(光流)和音频特征,实现剪辑动作识别;采用双流LSTM结合时间注意力和策略梯度方法进行密集视频字幕生成;并提出长短期关系网络(LSTR),结合时空注意力与基于图卷积网络(GCN)的长距离建模,实现时空动作定位,在AVA验证集上达到30.5%的mAP,在字幕测试集上达到8.49%的METEOR得分。
ABSTRACT
This notebook paper presents an overview and comparative analysis of our systems designed for the following three tasks in ActivityNet Challenge 2019: trimmed action recognition, dense-captioning events in videos, and spatio-temporal action localization.
研究动机与目标
- 通过利用帧、短片段和光流等多维时空线索,提升剪辑动作识别性能。
- 利用双层LSTM结合时间注意力与策略梯度优化,为未剪辑视频中的事件生成密集且自然的语言描述。
- 通过建模短期人类-上下文交互与跨片段的长期时间依赖,提升时空动作定位性能。
- 探究有效的特征量化策略——平均池化与时间卷积池化——在视频级表征学习中的作用。
- 在 ActivityNet Challenge 2019 中,实现三个视频理解任务的最先进性能。
提出的方法
- 利用2D与3D卷积神经网络(LGD-P3D)从视频片段中提取外观、运动与音频特征,采用ResNet-101或Xception作为主干网络。
- 应用平均池化与一种新颖的一维时间卷积池化(TCP),其包含5个深度可分离残差块,用于从片段级特征生成视频级表征。
- 采用双流框架,输入为RGB与光流,通过晚期融合策略融合预测结果,以提升动作识别与定位性能。
- 设计了长短期关系网络(LSTR),通过3D区域提议池化(RoI pooling)提取提议特征,随后应用时空注意力建模局部上下文,并利用图卷积网络(GCN)建模跨片段的长距离依赖。
- 采用双层LSTM结合时间注意力与策略梯度优化,生成基于视频表征与检测属性条件的句子描述。
- 采用分类-检测联合管道进行事件提议定位,随后利用注意力机制加权的视频特征与属性条件生成句子。
实验结果
研究问题
- RQ1当有效融合时,帧、片段与运动等多维时空线索在剪辑动作识别中的贡献机制如何?
- RQ2结合时间注意力与策略梯度优化的双流LSTM能否显著提升在ActivityNet Captions数据集上的密集视频字幕生成性能?
- RQ3如何联合建模短期人类-上下文交互与长期时间动态,以增强时空动作定位性能?
- RQ4在视频理解任务中,平均池化与时间卷积池化在视频级表征学习中的相对有效性如何?
- RQ5对RGB、光流与音频等多模态特征进行晚期融合,能在多大程度上提升动作识别、字幕生成与定位任务的性能?
主要发现
- 所提系统在AVA验证集上实现30.5%的mAP,用于时空动作定位,采用RGB与光流双流晚期融合结合多尺度推理。
- 在字幕模型中引入策略梯度优化后,METEOR得分从验证集的9.81提升至10.30,测试集上达到8.49%。
- 时间卷积池化(TCP)相比平均池化生成更具判别性的视频级表征,有助于提升识别性能。
- LSTR框架结合时空注意力与基于GCN的长距离建模,显著增强了动作定位的特征表征能力,有效捕捉局部交互与全局动态。
- 帧、运动与音频特征的晚期融合显著提升了剪辑动作识别性能,验证了多线索融合的价值。
- 该系统在ActivityNet Challenge 2019框架下,于动作识别、密集字幕生成与定位三个不同任务中均展现出优异的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。