Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Temporal Action Localization via Representative Snippet Knowledge Propagation

Linjiang Huang, Liang Wang|arXiv (Cornell University)|Mar 6, 2022
Human Pose and Action Recognition被引用 4
一句话总结

该论文提出了一种弱监督时序动作定位方法,通过在视频内部及跨视频传播代表性视频片段的知识,提升了伪标签的质量。利用记忆库和二分图随机游走模块,该方法优化了特征表示,生成更精确的时序类别激活图,在THUMOS14上实现了1.2%的mAP提升,达到当前最先进性能,并在多个基线模型上表现出一致的性能提升。

ABSTRACT

Weakly supervised temporal action localization aims to localize temporal boundaries of actions and simultaneously identify their categories with only video-level category labels. Many existing methods seek to generate pseudo labels for bridging the discrepancy between classification and localization, but usually only make use of limited contextual information for pseudo label generation. To alleviate this problem, we propose a representative snippet summarization and propagation framework. Our method seeks to mine the representative snippets in each video for propagating information between video snippets to generate better pseudo labels. For each video, its own representative snippets and the representative snippets from a memory bank are propagated to update the input features in an intra- and inter-video manner. The pseudo labels are generated from the temporal class activation maps of the updated features to rectify the predictions of the main branch. Our method obtains superior performance in comparison to the existing methods on two benchmarks, THUMOS14 and ActivityNet1.3, achieving gains as high as 1.2% in terms of average mAP on THUMOS14.

研究动机与目标

  • 为解决弱监督时序动作定位中视频级分类与片段级定位之间的差异问题。
  • 通过利用单个片段之外的上下文信息,提升伪标签质量。
  • 利用代表性片段作为知识载体,实现在视频内部及跨视频的知识迁移。
  • 减少对具有判别性或背景片段的依赖,避免其对定位造成误导。
  • 在仅使用视频级标签的最小监督设置下,实现最先进性能。

提出的方法

  • 使用期望最大化注意力机制识别每段视频中的代表性片段,以应对视角、动作和背景的差异。
  • 维护一个记忆库,存储来自所有视频的高置信度代表性片段,以实现跨视频知识迁移。
  • 采用二分图随机游走(BiRW)模块,通过传播视频内部及跨视频的代表性片段知识来更新视频特征。
  • 利用更新后的特征生成优化的时序类别激活图(TCAMs),作为在线伪标签以校正主模型的预测结果。
  • 采用双分支训练策略:主分支从视频级标签学习,辅助分支从伪标签学习,以增强对代表性片段的关注。
  • 应用残差连接以在迭代传播过程中稳定特征更新,防止梯度消失。

实验结果

研究问题

  • RQ1能否通过视频中的代表性片段及记忆库提升弱监督时序动作定位中的伪标签质量?
  • RQ2从代表性片段进行的视频内及跨视频知识传播如何影响定位准确率?
  • RQ3在弱监督设置下,传播特征而非分数是否能带来更好的性能?
  • RQ4所提出的框架是否能通过极少的架构改动,持续改进现有的最先进方法?
  • RQ5在性能与训练稳定性之间取得平衡时,最优的传播迭代次数是多少?

主要发现

  • 与先前方法相比,该方法在THUMOS14上的平均mAP绝对提升了1.2%,证明了其最先进性能。
  • 在ActivityNet1.3上,该方法也取得了更优性能,证实了其在不同数据集上的泛化能力。
  • 消融实验证明,使用加权特征传播(带残差连接)优于直接传播或基于分数的传播。
  • 该方法在多个基线模型(包括STPN、BM、WUM和FAC-Net)上均实现性能提升,mAP提升最高达4.8%。
  • 最优传播迭代次数为5次,因为更多迭代会导致因梯度不稳定性而性能下降。
  • 记忆库机制在保持低GPU显存开销的同时,实现了有效的跨视频知识迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。