[论文解读] Two-Stream Consensus Network for Weakly-Supervised Temporal Action Localization
本文提出了一种两流共识网络(TSCN)用于弱监督时序动作定位,通过从晚期融合注意力中迭代优化帧级伪真实标签,以提升模型监督效果并减少误报。该方法引入了一种注意力归一化损失,促使注意力值趋向二值极值(0或1),从而通过固定的0.5阈值实现高质量的动作提议,在THUMOS14和ActivityNet数据集上达到最先进性能。
Weakly-supervised Temporal Action Localization (W-TAL) aims to classify and localize all action instances in an untrimmed video under only video-level supervision. However, without frame-level annotations, it is challenging for W-TAL methods to identify false positive action proposals and generate action proposals with precise temporal boundaries. In this paper, we present a Two-Stream Consensus Network (TSCN) to simultaneously address these challenges. The proposed TSCN features an iterative refinement training method, where a frame-level pseudo ground truth is iteratively updated, and used to provide frame-level supervision for improved model training and false positive action proposal elimination. Furthermore, we propose a new attention normalization loss to encourage the predicted attention to act like a binary selection, and promote the precise localization of action instance boundaries. Experiments conducted on the THUMOS14 and ActivityNet datasets show that the proposed TSCN outperforms current state-of-the-art methods, and even achieves comparable results with some recent fully-supervised methods.
研究动机与目标
- 为解决弱监督时序动作定位(W-TAL)中缺乏帧级标注时的误报动作提议问题。
- 通过消除对固定且经验性选择的阈值的依赖,提升基于注意力的定位中动作提议的质量。
- 通过晚期融合利用RGB与光流流的互补优势,生成更精确的帧级伪监督信号。
- 通过鼓励注意力图呈现类似二值的激活模式,减少其模糊性,实现更精确的边界定位。
- 仅使用视频级标签进行训练,实现与全监督方法相当的性能。
提出的方法
- 采用迭代优化训练方案,从RGB与光流流的晚期融合注意力输出中生成帧级伪真实标签。
- 利用伪真实标签作为细粒度监督信号,重新训练两个流模型,逐步提升定位准确率并减少误报。
- 提出一种新颖的注意力归一化损失,促使预测的注意力值趋向0或1,最小化模糊性并提升提议精度。
- 晚期融合通过可学习权重结合RGB与光流流的注意力图,生成比单一流更鲁棒的共识输出。
- 该方法首先在视频级标签上训练两流模型,随后在迭代循环中交替进行伪标签优化与模型微调。
- 通过在0.5阈值处对融合注意力图进行阈值化处理生成动作提议,得益于归一化的注意力分布,可获得高质量结果。
实验结果
研究问题
- RQ1能否通过利用晚期融合注意力生成的伪真实标签进行迭代优化,提升弱监督时序动作定位中的定位准确率?
- RQ2注意力归一化损失是否能有效减少注意力图中的模糊性,并支持使用固定阈值生成高质量动作提议?
- RQ3RGB与光流流的晚期融合是否能提供优于单一流模型的帧级监督信号?
- RQ4弱监督方法在多大程度上可实现与全监督基线相当的性能?
- RQ5外观与运动模态的互补优势如何共同促进基于共识的定位?
主要发现
- 在THUMOS14数据集上,使用伪真实标签训练的TSCN模型在IoU=0.5时达到45.0%的平均精度(mAP),显著优于仅使用视频的基线模型(40.9%)。
- 在ActivityNet数据集上,采用伪监督的融合模型在IoU=0.5时达到44.6% mAP,高于无伪监督时的44.4%,表明性能持续提升。
- RGB流在伪监督下精度与召回率显著提升,分别从仅使用视频的13.2%和8.2%提高至22.1%和14.4%。
- 光流流在伪监督下F-measure提升0.6%(从32.07增至35.73),表明精确率与召回率的平衡得到改善。
- 在THUMOS14上,采用伪监督的融合模型实现31.3%的精度与44.6%的mAP,表明共识学习同时提升了定位质量与整体性能。
- 定性结果表明,伪监督有效减少了误报并改善了边界对齐,尤其在相邻动作实例或异常摄像机角度等挑战性场景中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。