[论文解读] ASM-Loc: Action-aware Segment Modeling for Weakly-Supervised Temporal Action Localization
ASM-Loc 提出了一种新颖的弱监督时序动作定位框架,通过引入动作感知的片段建模,克服了标准 MIL 基方法的局限性。通过结合动态片段采样、片段内与片段间注意力机制、伪实例级监督以及多步优化,ASM-Loc 在 THUMOS-14 和 ActivityNet-v1.3 上均取得了当前最优性能,相较于之前的方法,mAP 分别提升了 4.8% 和 2.4%。
Weakly-supervised temporal action localization aims to recognize and localize action segments in untrimmed videos given only video-level action labels for training. Without the boundary information of action segments, existing methods mostly rely on multiple instance learning (MIL), where the predictions of unlabeled instances (i.e., video snippets) are supervised by classifying labeled bags (i.e., untrimmed videos). However, this formulation typically treats snippets in a video as independent instances, ignoring the underlying temporal structures within and across action segments. To address this problem, we propose \system, a novel WTAL framework that enables explicit, action-aware segment modeling beyond standard MIL-based methods. Our framework entails three segment-centric components: (i) dynamic segment sampling for compensating the contribution of short actions; (ii) intra- and inter-segment attention for modeling action dynamics and capturing temporal dependencies; (iii) pseudo instance-level supervision for improving action boundary prediction. Furthermore, a multi-step refinement strategy is proposed to progressively improve action proposals along the model training process. Extensive experiments on THUMOS-14 and ActivityNet-v1.3 demonstrate the effectiveness of our approach, establishing new state of the art on both datasets. The code and models are publicly available at~\url{https://github.com/boheumd/ASM-Loc}.
研究动机与目标
- 通过建模超越标准 MIL 的时序结构,弥合弱监督与全监督时序动作定位之间的性能差距。
- 克服基于 MIL 方法的常见缺陷,如短时动作漏检以及定位不完整或过度完整。
- 通过引入以片段为中心的组件,利用片段内与片段间的时序依赖关系,提升边界预测与定位完整性。
- 通过在伪实例级监督中引入不确定性估计,增强对噪声标签的鲁棒性。
- 采用多步训练策略,逐步优化动作提议,以提升定位准确性。
提出的方法
- 使用标准 MIL 基方法生成初始动作提议,作为以片段为中心建模的基础。
- 实施动态片段采样,根据提议时长动态计算缩放比例,对短时动作提议进行过采样,以平衡短时与长时动作的贡献。
- 引入片段内注意力模块,在每个动作提议内部应用自注意力机制,以建模动作动态并抑制背景噪声。
- 提出片段间注意力模块,跨不同动作提议应用自注意力机制,以捕捉动作之间的时序依赖关系(例如,“CricketsBowling” 后接 “CricketsShotting”)。
- 应用带有不确定性估计的伪实例级损失,以优化边界预测并减少噪声伪标签的影响。
- 采用多步优化策略,在多个训练阶段中迭代改进动作提议,从而逐步提升定位性能。
实验结果
研究问题
- RQ1显式地基于片段的建模是否能超越标准 MIL 基框架,提升弱监督时序动作定位性能?
- RQ2在动作片段内部及跨片段建模时序结构,对定位准确率与边界预测有何影响?
- RQ3对短时动作片段进行动态采样,在多大程度上能提升其检测性能?
- RQ4在伪实例级监督中引入不确定性估计,在缓解标签噪声方面有多有效?
- RQ5对动作提议进行多步优化,是否能在弱监督 TAL 中带来一致的性能增益?
主要发现
- 在 THUMOS-14 上,ASM-Loc 达到 45.1% 的 mAP,创下新 SOTA,相比基线提升 4.8%。
- 在 ActivityNet-v1.3 上,ASM-Loc 达到 45.1% 的 mAP,相比之前 SOTA 提升 2.4%,在多个数据集上均表现出一致的性能增益。
- 动态片段采样模块使额外短时(XS)片段的定位性能提升 +4.9%,短时(S)片段提升 +1.2%。
- 片段内注意力模块显著优于全局注意力与仅关注背景的注意力设置,证明了以片段为中心的自注意力机制的必要性。
- 在伪实例级监督中引入不确定性估计,使平均 mAP 提升 1%,表明其在降低噪声影响方面的有效性。
- 多步优化策略随着步骤增加而持续提升性能,3 步已足够使性能达到饱和。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。