Skip to main content
QUICK REVIEW

[论文解读] Similarity R-C3D for Few-shot Temporal Activity Detection

Huijuan Xu, Bingyi Kang|arXiv (Cornell University)|Dec 25, 2018
Human Pose and Action Recognition参考文献 37被引用 11
一句话总结

本文提出了一种名为 Similarity R-C3D 的新型端到端少样本时序动作检测框架,采用两阶段提议网络,并通过视频提议与少样本样本之间的余弦相似度匹配,实现对罕见动作的定位与分类。该方法在 THUMOS14、ActivityNet1.2 和 ActivityNet1.3 数据集上均取得了最先进性能,且在提供更多少样本示例时,准确率显著提升。

ABSTRACT

Many activities of interest are rare events, with only a few labeled examples available. Therefore models for temporal activity detection which are able to learn from a few examples are desirable. In this paper, we present a conceptually simple and general yet novel framework for few-shot temporal activity detection which detects the start and end time of the few-shot input activities in an untrimmed video. Our model is end-to-end trainable and can benefit from more few-shot examples. At test time, each proposal is assigned the label of the few-shot activity class corresponding to the maximum similarity score. Our Similarity R-C3D method outperforms previous work on three large-scale benchmarks for temporal activity detection (THUMOS14, ActivityNet1.2, and ActivityNet1.3 datasets) in the few-shot setting. Our code will be made available.

研究动机与目标

  • 为解决在仅有一两个标注样本的情况下,从未修剪的视频中检测罕见且未见过的动作的挑战。
  • 克服基于滑动窗口的方法所面临的高计算成本和刚性边界约束的局限性。
  • 实现端到端学习,随着少样本示例的增加而性能提升,这与以往方法在增加样本时无明显收益形成对比。
  • 开发一个统一框架,通过相似度匹配联合优化提议生成与少样本分类。
  • 在多个大规模基准上展示方法的泛化能力与最先进性能。

提出的方法

  • 模型使用 3D 卷积神经网络(C3D)从未修剪的测试视频和少样本修剪的样本视频中提取时空特征。
  • 两阶段提议网络生成并优化时序动作提议,第二阶段生成前景片段提议。
  • 少样本分类分支与主 C3D 分支共享权重,并计算提议特征与少样本样本特征之间的余弦相似度。
  • 每个提议被分配给余弦相似度得分最高的少样本样本的类别标签。
  • 最终检测结果由提议置信度得分(用于过滤背景)与相似度得分(用于分配类别)共同决定。
  • 整个模型可端到端训练,并在训练过程中受益于更多少样本示例。

实验结果

研究问题

  • RQ1统一的、端到端的框架是否能通过利用更多少样本示例,提升少样本时序动作检测性能?
  • RQ2用两阶段优化网络替代基于滑动窗口的提议生成,是否能带来更高的定位准确率?
  • RQ3基于学习特征的相似度分类方法是否能在少样本设置下超越以往的匹配网络风格方法?
  • RQ4随着少样本示例数量的增加,模型是否表现出数据驱动的性能提升?
  • RQ5该方法在 THUMOS14、ActivityNet1.2 和 ActivityNet1.3 等多样化基准上的泛化能力如何?

主要发现

  • 在 ActivityNet1.2 数据集上,Similarity R-C3D 在五少样本设置下实现了 45.8% 的 mAP@0.5 和 28.2% 的平均 mAP,显著优于先前最先进方法(滑动窗口方法:23.1% mAP@0.5,10.0% 平均 mAP)。
  • 模型从单样本学习到五样本学习的性能提升显著(mAP@0.5 从 39.4% 提升至 45.8%),证明了额外少样本示例的有益作用。
  • CDC 模型基线表现较差,仅取得 8.2% 的 mAP@0.5,凸显了在未修剪视频上进行少样本检测的挑战。
  • 消融实验表明,尽管微调提议网络略有帮助,但主要性能提升来自与少样本数据联合进行的端到端学习。
  • 最优提议得分阈值为 0.3,表明检测中提议数量与质量之间存在权衡。
  • 定性结果表明,该模型能正确地在多个数据集上定位多样化的动作,包括复杂且持续时间较长的动作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。