[论文解读] RefineLoc: Iterative Refinement for Weakly-Supervised Action Localization
RefineLoc 提出了一种弱监督动作定位的迭代精炼框架,通过在每次训练迭代中生成并利用片段级别的伪真实标签来提升定位精度。通过利用前序迭代的伪标签对预测进行精炼,RefineLoc 在 THUMOS14 上实现了最先进性能,并显著提升了现有 SOTA 方法的表现,证明了在弱监督视频动作定位中迭代精炼的有效性。
Video action detectors are usually trained using datasets with fully-supervised temporal annotations. Building such datasets is an expensive task. To alleviate this problem, recent methods have tried to leverage weak labeling, where videos are untrimmed and only a video-level label is available. In this paper, we propose RefineLoc, a novel weakly-supervised temporal action localization method. RefineLoc uses an iterative refinement approach by estimating and training on snippet-level pseudo ground truth at every iteration. We show the benefit of this iterative approach and present an extensive analysis of five different pseudo ground truth generators. We show the effectiveness of our model on two standard action datasets, ActivityNet v1.2 and THUMOS14. RefineLoc shows competitive results with the state-of-the-art in weakly-supervised temporal localization. Additionally, our iterative refinement process is able to significantly improve the performance of two state-of-the-art methods, setting a new state-of-the-art on THUMOS14.
研究动机与目标
- 通过仅使用视频级别标签来训练,以应对全标注时序动作定位数据集的高昂成本。
- 在无时序标注的弱监督设置下提升定位性能。
- 缩小弱监督与全监督动作定位方法之间的性能差距。
- 开发一种适用于多种基础模型和数据集的通用迭代精炼策略。
提出的方法
- RefineLoc 采用迭代训练流程,基于前序模型的预测结果在每次迭代中生成伪真实标签。
- 通过结合注意力分数和分类置信度生成片段级别的伪标签,以近似前景和背景片段。
- 在这些伪标签上以监督方式重新训练模型,并通过随机采样片段来防止对简单样本的过拟合。
- 评估了五种不同的伪真实标签生成策略,以确定最有效的配置。
- 将该精炼过程应用于基础模型及现有 SOTA 方法,证明了其泛化能力与性能提升。
- 该方法设计为与 TSN、W-TALC 和 BaS-Net 等标准主干网络兼容,实现即插即用的性能提升。
实验结果
研究问题
- RQ1使用伪真实标签进行的迭代精炼是否能显著提升弱监督时序动作定位性能?
- RQ2伪真实标签生成器的选择如何影响不同数据集和模型上的模型表现?
- RQ3迭代精炼过程在多大程度上能提升现有最先进弱监督动作定位方法的性能?
- RQ4迭代精炼策略是否能随时间减少定位错误并提升预测覆盖范围?
- RQ5该方法是否能在不同主干架构和特征提取器之间实现良好泛化?
主要发现
- 在使用 TSN 特征时,RefineLoc 在 ActivityNet v1.2 上实现了与最先进方法相当的性能。
- 当应用于 BaS-Net 和 W-TALC 基线模型时,RefineLoc 在 THUMOS14 上取得了新的最先进结果,IoU=0.3 时达到 45.10 mAP。
- 迭代精炼过程随时间减少了背景错误和定位错误,DETAD 误报分析结果已证实这一点。
- RefineLoc 提升了检测覆盖范围,并在迭代过程中合并了分离的预测结果,定性结果已证明这一点。
- 该方法泛化良好:当应用于 W-TALC 时,经过 2 次迭代,mAP 从 42.98 提升至 44.10(IoU=0.3)。
- 尽管性能有所提升,但因初始分类模块过于简单,混淆错误略有增加,表明定位与分类精度之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。