[论文解读] Adversarial Background-Aware Loss for Weakly-supervised Temporal Activity Localization
该论文提出A2CL-PT,一种新颖的弱监督时序动作定位方法,通过在特征空间中使用两个三元组来增强特征判别能力:一个用于类别特定特征,另一个则显式区分背景与活动相关特征。该方法采用对抗性两分支网络以提升定位完整性,在THUMOS14数据集上于IoU阈值0.1–0.9范围内实现了30.0%的新SOTA mAP。
Temporally localizing activities within untrimmed videos has been extensively studied in recent years. Despite recent advances, existing methods for weakly-supervised temporal activity localization struggle to recognize when an activity is not occurring. To address this issue, we propose a novel method named A2CL-PT. Two triplets of the feature space are considered in our approach: one triplet is used to learn discriminative features for each activity class, and the other one is used to distinguish the features where no activity occurs (i.e. background features) from activity-related features for each video. To further improve the performance, we build our network using two parallel branches which operate in an adversarial way: the first branch localizes the most salient activities of a video and the second one finds other supplementary activities from non-localized parts of the video. Extensive experiments performed on THUMOS14 and ActivityNet datasets demonstrate that our proposed method is effective. Specifically, the average mAP of IoU thresholds from 0.1 to 0.9 on the THUMOS14 dataset is significantly improved from 27.9% to 30.0%.
研究动机与目标
- 解决弱监督时序动作定位中模型无法识别无活动发生情况的局限性。
- 通过显式建模背景特征与活动相关特征的差异,提升模型鲁棒性。
- 通过引入对抗性两分支架构,提升定位完整性,以捕捉补充的活动片段。
- 克服现有方法在背景与前景活动特征区分不足的缺陷。
- 设计一种损失函数,结合判别性特征学习与背景感知表征,采用一对三元组实现。
提出的方法
- 提出双三元组损失机制:一个三元组(F, c, cₙ)用于学习每类的判别性特征,另一个三元组(c, F, f)用于区分背景特征(f)与活动特征(F)。
- 利用视频级聚合特征(F)和背景感知特征(f)构成第二个三元组,实现对背景的显式建模。
- 设计两分支网络,其中一支分支用于定位主要活动,另一支用于在未定位区域中识别补充活动。
- 通过对抗性方式训练两个分支,以促进互补学习,注意力权重通过可学习参数α动态调整。
- 集成一种适用于可变长度视频特征的角中心损失(ATCL)变体,利用类别中心和负中心以改善特征聚类。
- 通过超参数ω对两个分支的T-CAMs进行加权融合,以平衡贡献,当ω ≤ 1时性能最优。
实验结果
研究问题
- RQ1显式建模背景特征是否能提升弱监督时序动作定位性能?
- RQ2两分支间对抗性训练如何增强定位完整性和准确性?
- RQ3双三元组损失结构对特征判别与背景分离有何影响?
- RQ4超参数α与ω如何影响两对抗分支的性能与平衡?
- RQ5所提方法是否在THUMOS14和ActivityNet等标准基准上优于现有SOTA方法?
主要发现
- A2CL-PT在THUMOS14数据集上于IoU阈值0.1至0.9范围内实现了30.0%的新SOTA平均mAP,相较之前工作的27.9%显著提升。
- 消融实验表明,双三元组损失与对抗性训练组件均显著提升性能,完整方法优于各消融变体。
- α值为正时性能持续提升,证明注意力加权融合机制在结合两分支T-CAMs方面具有有效性。
- 当ω > 1时性能下降,表明对抗分支的T-CAMs不应主导,而应作为补充信息提供。
- 定性分析显示,A2CL-PT在模糊情况(如标为投掷的标枪投掷)中显著减少误报,并能正确识别标注中的真实错误。
- 该方法在多种活动类别(如HighJump、JavelinThrow、HammerThrow)上泛化良好,在THUMOS14测试集上保持一致的定位精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。