Skip to main content
QUICK REVIEW

[论文解读] Segregated Temporal Assembly Recurrent Networks for Weakly Supervised Multiple Action Detection

Yunlu Xu, Chengwei Zhang|arXiv (Cornell University)|Nov 19, 2018
Human Pose and Action Recognition参考文献 39被引用 8
一句话总结

该论文提出了一种用于弱监督多动作检测的分离时序聚合循环网络(STAR)网络,通过类别特定注意力机制聚合动作片段,并利用增强的RNN建模动作之间的时序关系。该方法在THUMOS’14和ActivityNet1.3数据集上实现了最先进性能,优于以往的弱监督方法,并在mAP指标上与全监督基线方法相当。

ABSTRACT

This paper proposes a segregated temporal assembly recurrent (STAR) network for weakly-supervised multiple action detection. The model learns from untrimmed videos with only supervision of video-level labels and makes prediction of intervals of multiple actions. Specifically, we first assemble video clips according to class labels by an attention mechanism that learns class-variable attention weights and thus helps the noise relieving from background or other actions. Secondly, we build temporal relationship between actions by feeding the assembled features into an enhanced recurrent neural network. Finally, we transform the output of recurrent neural network into the corresponding action distribution. In order to generate more precise temporal proposals, we design a score term called segregated temporal gradient-weighted class activation mapping (ST-GradCAM) fused with attention weights. Experiments on THUMOS'14 and ActivityNet1.3 datasets show that our approach outperforms the state-of-the-art weakly-supervised method, and performs at par with the fully-supervised counterparts.

研究动机与目标

  • 解决仅使用视频级别标签时在未修剪视频中进行弱监督多动作检测的挑战。
  • 通过学习类别特定的注意力权重来减少背景和无关动作的干扰,实现动作特征的聚合。
  • 通过增强的循环神经网络建模多个并发动作之间的时序依赖关系。
  • 通过将新型ST-GradCAM与注意力权重融合,提升定位精度,用于时序提议生成。
  • 缩小弱监督与全监督动作检测方法之间的性能差距。

提出的方法

  • 采用类别可变的注意力机制,将视频片段聚合为每类动作的实例模式,最大限度减少背景和无关动作的干扰。
  • 将聚合后的特征输入增强的循环神经网络(RNN),以学习多个动作之间的时序关系。
  • 在RNN中引入重复对齐机制,自适应调整注意力权重,实现更精细的动作提议生成。
  • 设计一种分离时序梯度类激活映射(ST-GradCAM),突出显示特定动作类别的重要特征,并与注意力权重融合以实现定位。
  • 仅使用视频级别标签,以端到端方式训练整个框架。
  • 评估时采用IoU阈值0.1–0.5,以mAP作为THUMOS’14和ActivityNet1.3的主要指标。

实验结果

研究问题

  • RQ1仅使用视频级别标签的弱监督框架能否有效定位未修剪视频中的多个动作?
  • RQ2如何设计注意力机制以在特征聚合过程中减少背景和无关动作的干扰?
  • RQ3在弱监督设置下,建模动作之间的时序关系能在多大程度上提升定位性能?
  • RQ4与标准GradCAM相比,融合类别特定注意力的新型ST-GradCAM方法能否显著提升时序提议的准确性?
  • RQ5所提出的STAR框架在基准数据集上与弱监督及全监督最先进方法相比表现如何?

主要发现

  • 在THUMOS’14上,STAR在IoU=0.1时达到68.8%的平均平均精度(mAP),在IoU=0.2时达到60.0%,显著优于所有报告的弱监督方法。
  • 在THUMOS’14上,STAR在平均mAP上比之前最佳弱监督方法高出7%,且在IoU=0.1和0.2时均超过所有全监督方法。
  • 在ActivityNet1.3上,STAR在IoU=0.5时达到31.1%的mAP,平均mAP相比之前最佳弱监督方法提升2%。
  • STAR显著缩小了弱监督与全监督方法之间的性能差距,在缺乏帧级标注的情况下,其在THUMOS’14上的表现可与强的全监督基线方法相媲美。
  • 消融实验表明,基于注意力的特征聚合与ST-GradCAM组件均对性能至关重要,任一组件的移除均导致mAP显著下降。
  • 该方法在不同动作密度下均表现出良好泛化能力,即使在高动作密度视频中也能保持高mAP,如图8所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。