[论文解读] Action Unit Memory Network for Weakly Supervised Temporal Action Localization
本文提出了一种新型弱监督时序动作定位框架——动作单元记忆网络(AUMN),通过可学习的记忆库对视觉-模式模板进行建模,以捕捉动作单元。通过引入跨注意力实现片段-分类器对齐,结合自注意力实现上下文平滑,并辅以多样性、同质性和稀疏性机制,AUMN在THUMOS14数据集上将平均mAP从47.0%提升至52.1%(IoU阈值范围0.1–0.5),达到当前最优性能。
Weakly supervised temporal action localization aims to detect and localize actions in untrimmed videos with only video-level labels during training. However, without frame-level annotations, it is challenging to achieve localization completeness and relieve background interference. In this paper, we present an Action Unit Memory Network (AUMN) for weakly supervised temporal action localization, which can mitigate the above two challenges by learning an action unit memory bank. In the proposed AUMN, two attention modules are designed to update the memory bank adaptively and learn action units specific classifiers. Furthermore, three effective mechanisms (diversity, homogeneity and sparsity) are designed to guide the updating of the memory network. To the best of our knowledge, this is the first work to explicitly model the action units with a memory network. Extensive experimental results on two standard benchmarks (THUMOS14 and ActivityNet) demonstrate that our AUMN performs favorably against state-of-the-art methods. Specifically, the average mAP of IoU thresholds from 0.1 to 0.5 on the THUMOS14 dataset is significantly improved from 47.0% to 52.1%.
研究动机与目标
- 解决仅使用视频级标签时弱监督时序动作定位(TAL)中的定位完整性与背景干扰问题。
- 通过学习模板的记忆库,显式建模动作单元——即跨动作类别共享的可重用视觉-模式图样。
- 通过在记忆模板学习中强制实现多样性、同质性和稀疏性,提升定位鲁棒性。
- 通过双注意力机制统一时序上下文建模与类别特定注意力,实现更优的特征优化。
- 在无需帧级标注的情况下,实现在标准基准上的最先进性能。
提出的方法
- 记忆库存储学习到的动作单元模板,代表动作间共享的视觉与运动模式,如“跑步”或“跳跃”。
- 跨注意力模块计算片段与模板之间的相似度,以动态分配每个视频片段的动作分类器。
- 自注意力模块聚合片段间的时序上下文,生成更平滑、更完整的类别激活序列(CAS)。
- 通过三种辅助损失组件——多样性(L_d)、同质性(L_h)和稀疏性(L_s)——自适应更新记忆库,以确保模板具有唯一性、紧凑性和稀疏性。
- 模型仅使用视频级标签进行端到端训练,MLP头将模板投影到动作类别空间以实现分类。
- 通过模板相似度与注意力分数的加权融合生成片段级预测,实现定位与记忆学习的联合优化。
实验结果
研究问题
- RQ1可学习的动作单元模板记忆库是否能提升弱监督TAL中的定位完整性?
- RQ2在仅具备视频级监督的未剪辑视频中,如何有效建模并区分共享的视觉-模式图样(即动作单元)?
- RQ3多样性、同质性和稀疏性机制在多大程度上提升了记忆库质量与定位性能?
- RQ4将自注意力机制用于上下文聚合,是否能生成更平滑、更完整的类别激活序列?
- RQ5所提出的AUMN框架是否能在THUMOS14和ActivityNet等标准基准上超越现有最先进方法?
主要发现
- AUMN框架在THUMOS14数据集上实现了新的最先进平均mAP,达到52.1%(IoU阈值范围0.1–0.5),相较先前的47.0%有显著提升。
- 自注意力模块在所有IoU阈值下均持续提升性能,尤其在较高阈值(0.4–0.6)时增益最大,表明定位完整性得到增强。
- 消融实验表明,同时采用多样性、同质性和稀疏性机制可在IoU = 0.5时带来3%的mAP增益,优于单一机制。
- 模板数量(K)对性能有正向影响,THUMOS14上K = 7时达到最优结果,表明动作单元得到了充分覆盖。
- 定性分析表明,不同模板关注不同的视觉模式——如“跑步”、“跳跃”、“投掷”——从而实现准确且具有区分度的定位。
- 可视化结果表明,自注意力模块增强了对判别性较弱但相关片段的置信度分数,减少了漏检,提升了定位完整性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。