Skip to main content
QUICK REVIEW

[论文解读] StartNet: Online Detection of Action Start in Untrimmed Videos

Mingfei Gao, Mingze Xu|arXiv (Cornell University)|Mar 23, 2019
Human Pose and Action Recognition参考文献 35被引用 11
一句话总结

StartNet 提出了一种两阶段框架,用于在未剪辑视频中在线检测动作起始点,通过 ClsNet 进行帧级动作分类,以及通过策略梯度优化实现类别无关的动作起始定位的 LocNet。在 THUMOS’14 上,其 p-mAP 比 SOTA 提高了 15–30%,在 ActivityNet 上实现了与 10 倍更小时间偏移相当的性能。

ABSTRACT

We propose StartNet to address Online Detection of Action Start (ODAS) where action starts and their associated categories are detected in untrimmed, streaming videos. Previous methods aim to localize action starts by learning feature representations that can directly separate the start point from its preceding background. It is challenging due to the subtle appearance difference near the action starts and the lack of training data. Instead, StartNet decomposes ODAS into two stages: action classification (using ClsNet) and start point localization (using LocNet). ClsNet focuses on per-frame labeling and predicts action score distributions online. Based on the predicted action scores of the past and current frames, LocNet conducts class-agnostic start detection by optimizing long-term localization rewards using policy gradient methods. The proposed framework is validated on two large-scale datasets, THUMOS'14 and ActivityNet. The experimental results show that StartNet significantly outperforms the state-of-the-art by 15%-30% p-mAP under the offset tolerance of 1-10 seconds on THUMOS'14, and achieves comparable performance on ActivityNet with 10 times smaller time offset.

研究动机与目标

  • 解决在流式未剪辑视频中在线检测动作起始点的挑战,其中及时检测对自动驾驶和监控等应用至关重要。
  • 克服联合分类-定位方法在动作起始附近细微视觉差异处表现不佳以及起始点标注稀疏的问题。
  • 将任务分解为两个阶段:帧级动作分类(ClsNet)和时间起始点定位(LocNet),以提高学习效率和性能。
  • 利用帧级动作标签作为稀疏起始点标注的代理,以提升泛化能力和模型鲁棒性。
  • 使用策略梯度的强化学习优化长期定位性能,以确保检测到的动作起始点在时间上具有一致性。

提出的方法

  • ClsNet 从输入视频中提取时空特征并聚合,生成帧级动作得分分布,作为下游定位任务的高层表示。
  • LocNet 处理由 ClsNet 输出的历史动作得分趋势,并使用策略梯度方法预测类别无关的起始概率,以优化长期定位奖励。
  • 该框架采用 ClsNet 和 LocNet 输出的晚期融合,生成具有更高时间准确性的最终动作起始预测。
  • LocNet 中的强化学习通过考虑过去决策来建模时间依赖性,确保检测到的动作起始点在时间上不会过于密集。
  • 该方法采用端到端训练,其中 ClsNet 在帧级动作标注上进行预训练,LocNet 通过策略梯度优化以最大化累积检测奖励。
  • 实验使用来自 TSN(带 BN-Inception)和 VGG-16(在 ImageNet 上预训练)的特征,证明即使使用简单的基于图像的特征,模型也具有鲁棒性。

实验结果

研究问题

  • RQ1将在线动作起始点检测分解为分类和定位两个阶段,是否相比联合学习能提升性能?
  • RQ2利用帧级动作标签作为稀疏起始点标注的代理,是否能提升在线动作起始点检测的泛化能力?
  • RQ3LocNet 中基于策略梯度的时间建模是否能提升长期检测一致性并减少动作起始点定位中的误报?
  • RQ4在不同时间偏移容忍度下,两阶段设计与单阶段联合分类-定位网络在 p-mAP 上的表现如何比较?
  • RQ5与原始低级特征相比,使用高层动作得分分布在多大程度上能提升检测性能?

主要发现

  • 在 THUMOS’14 上,StartNet 在 1–10 秒时间偏移容忍度下,p-mAP 比当前最先进方法高出 15–30%,显示出显著的性能提升。
  • 在 ActivityNet 上,StartNet 在 10 秒偏移容忍度下与先前工作性能相当,但使用 10 倍更小的时间偏移即达到相近结果,表明其具有更高的时间精度。
  • 加入 LocNet 后,使用 VGG 特征时 ClsNet 的性能提升超过 3% p-mAP,使用 TS 特征时提升约 4%,证明了时间建模的价值。
  • StartNet-PG(基于策略梯度的 LocNet)比 StartNet-CE(交叉熵训练)在 p-mAP 上高出 5–9%,尤其在小偏移容忍度下表现更优,验证了长期规划的有效性。
  • 定性结果表明,LocNet 能够检测到 ClsNet 因细微视觉变化而漏检的动作起始点,凸显了时间上下文的优势。
  • 即使仅使用在 ImageNet 上预训练的 VGG-16 特征,StartNet 仍能达到最先进性能,证实了该框架对特征质量的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。