Skip to main content
QUICK REVIEW

[论文解读] Faster-TAD: Towards Temporal Action Detection with Proposal Generation and Classification in a Unified Network

Shimin Chen, Chen Chen|arXiv (Cornell University)|Apr 6, 2022
Human Pose and Action Recognition被引用 7
一句话总结

Faster-TAD 提出了一种统一的、受 Faster-RCNN 启发的单阶段网络,用于时序动作检测,联合执行提议生成、分类和边界精炼。它引入了一个上下文自适应提议模块,包含邻近-类别、自注意力和交叉注意力机制,一个用于鲁棒回归的假提议生成模块,并利用原子动作特征,在 ActivityNet-1.3 上实现了 40.01% 的 SOTA mAP,在 SoccerNet-Action Spotting 上实现了 54.09% 的 SOTA mAP。

ABSTRACT

Temporal action detection (TAD) aims to detect the semantic labels and boundaries of action instances in untrimmed videos. Current mainstream approaches are multi-step solutions, which fall short in efficiency and flexibility. In this paper, we propose a unified network for TAD, termed Faster-TAD, by re-purposing a Faster-RCNN like architecture. To tackle the unique difficulty in TAD, we make important improvements over the original framework. We propose a new Context-Adaptive Proposal Module and an innovative Fake-Proposal Generation Block. What's more, we use atomic action features to improve the performance. Faster-TAD simplifies the pipeline of TAD and gets remarkable performance on lots of benchmarks, i.e., ActivityNet-1.3 (40.01% mAP), HACS Segments (38.39% mAP), SoccerNet-Action Spotting (54.09% mAP). It outperforms existing single-network detector by a large margin.

研究动机与目标

  • 解决多阶段时序动作检测流水线的低效性和不灵活性。
  • 通过利用提议之间及与原始视频之间的上下文和语义信息,提升提议质量和动作分类性能。
  • 通过一种新颖的假提议生成模块,结合与真实框不同的偏移量,提升边界回归的鲁棒性。
  • 展示原子动作特征在检测复杂、长时长人类动作方面的优势。
  • 在无需多阶段优化的统一端到端可训练框架中,实现 SOTA 性能。

提出的方法

  • 将类似 Faster-RCNN 的架构适配为联合优化提议生成、分类和边界回归的多任务损失机制。
  • 引入上下文自适应提议模块,结合邻近-类别提议、自注意力和交叉注意力模块,以增强提议的语义信息。
  • 提出假提议生成模块,通过生成相对于真实框具有不同偏移量的合成提议,提升回归的泛化能力。
  • 利用在 SEAL 数据集上预训练的原子动作特征作为辅助输入,以增强对复杂动作的表征能力。
  • 采用边界匹配置信度图进行提议生成,替代传统的锚框方法,以应对极端时长变化。
  • 在检测头之间共享特征,实现端到端训练和参数效率。

实验结果

研究问题

  • RQ1统一的单阶段网络是否能在简化流水线的同时实现时序动作检测的 SOTA 性能?
  • RQ2上下文自适应注意力机制在通过建模提议之间及与原始视频的关系来提升提议分类性能方面有多有效?
  • RQ3通过生成相对于真实框具有多样化偏移量的假提议,是否能提升边界回归的鲁棒性?
  • RQ4原子动作特征在多大程度上提升了对复杂、长时长人类动作的检测性能?
  • RQ5统一网络是否能在标准基准上同时优于多阶段方法,在准确率和效率方面均表现更优?

主要发现

  • Faster-TAD 在 ActivityNet-1.3 上实现了 40.01% 的 mAP,显著优于现有单网络检测器。
  • 在 HACS Segments 上,Faster-TAD 达到了 38.39% 的 mAP,展现出强大的跨数据集泛化能力。
  • 在 SoccerNet-Action Spotting 上,Faster-TAD 使用 Swin 主干网络在 3s 和 6s 片段上实现了 54.09% 的 mAP,创下新 SOTA 记录。
  • 消融实验表明,上下文自适应提议模块通过增强语义上下文建模,带来了 0.73% 的 mAP 提升。
  • 假提议模块使 mAP 提升 0.14%,表明其在边界回归泛化方面表现更优。
  • 原子动作特征带来 0.89% 的 mAP 提升,证实其在复杂动作检测中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。