Skip to main content
QUICK REVIEW

[论文解读] Two-Stream Consensus Network for Weakly-Supervised Temporal Action Localization

Yuanhao Zhai, Le Wang|arXiv (Cornell University)|Oct 22, 2020
Human Pose and Action Recognition参考文献 47被引用 14
一句话总结

本文提出了一种两流共识网络(TSCN)用于弱监督时序动作定位,通过从晚期融合注意力中迭代优化帧级伪真实标签,以提升模型监督效果并减少误报。该方法引入了一种注意力归一化损失,促使注意力值趋向二值极值(0或1),从而通过固定的0.5阈值实现高质量的动作提议,在THUMOS14和ActivityNet数据集上达到最先进性能。

ABSTRACT

Weakly-supervised Temporal Action Localization (W-TAL) aims to classify and localize all action instances in an untrimmed video under only video-level supervision. However, without frame-level annotations, it is challenging for W-TAL methods to identify false positive action proposals and generate action proposals with precise temporal boundaries. In this paper, we present a Two-Stream Consensus Network (TSCN) to simultaneously address these challenges. The proposed TSCN features an iterative refinement training method, where a frame-level pseudo ground truth is iteratively updated, and used to provide frame-level supervision for improved model training and false positive action proposal elimination. Furthermore, we propose a new attention normalization loss to encourage the predicted attention to act like a binary selection, and promote the precise localization of action instance boundaries. Experiments conducted on the THUMOS14 and ActivityNet datasets show that the proposed TSCN outperforms current state-of-the-art methods, and even achieves comparable results with some recent fully-supervised methods.

研究动机与目标

  • 为解决弱监督时序动作定位(W-TAL)中缺乏帧级标注时的误报动作提议问题。
  • 通过消除对固定且经验性选择的阈值的依赖,提升基于注意力的定位中动作提议的质量。
  • 通过晚期融合利用RGB与光流流的互补优势,生成更精确的帧级伪监督信号。
  • 通过鼓励注意力图呈现类似二值的激活模式,减少其模糊性,实现更精确的边界定位。
  • 仅使用视频级标签进行训练,实现与全监督方法相当的性能。

提出的方法

  • 采用迭代优化训练方案,从RGB与光流流的晚期融合注意力输出中生成帧级伪真实标签。
  • 利用伪真实标签作为细粒度监督信号,重新训练两个流模型,逐步提升定位准确率并减少误报。
  • 提出一种新颖的注意力归一化损失,促使预测的注意力值趋向0或1,最小化模糊性并提升提议精度。
  • 晚期融合通过可学习权重结合RGB与光流流的注意力图,生成比单一流更鲁棒的共识输出。
  • 该方法首先在视频级标签上训练两流模型,随后在迭代循环中交替进行伪标签优化与模型微调。
  • 通过在0.5阈值处对融合注意力图进行阈值化处理生成动作提议,得益于归一化的注意力分布,可获得高质量结果。

实验结果

研究问题

  • RQ1能否通过利用晚期融合注意力生成的伪真实标签进行迭代优化,提升弱监督时序动作定位中的定位准确率?
  • RQ2注意力归一化损失是否能有效减少注意力图中的模糊性,并支持使用固定阈值生成高质量动作提议?
  • RQ3RGB与光流流的晚期融合是否能提供优于单一流模型的帧级监督信号?
  • RQ4弱监督方法在多大程度上可实现与全监督基线相当的性能?
  • RQ5外观与运动模态的互补优势如何共同促进基于共识的定位?

主要发现

  • 在THUMOS14数据集上,使用伪真实标签训练的TSCN模型在IoU=0.5时达到45.0%的平均精度(mAP),显著优于仅使用视频的基线模型(40.9%)。
  • 在ActivityNet数据集上,采用伪监督的融合模型在IoU=0.5时达到44.6% mAP,高于无伪监督时的44.4%,表明性能持续提升。
  • RGB流在伪监督下精度与召回率显著提升,分别从仅使用视频的13.2%和8.2%提高至22.1%和14.4%。
  • 光流流在伪监督下F-measure提升0.6%(从32.07增至35.73),表明精确率与召回率的平衡得到改善。
  • 在THUMOS14上,采用伪监督的融合模型实现31.3%的精度与44.6%的mAP,表明共识学习同时提升了定位质量与整体性能。
  • 定性结果表明,伪监督有效减少了误报并改善了边界对齐,尤其在相邻动作实例或异常摄像机角度等挑战性场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。