Skip to main content
QUICK REVIEW

[论文解读] Incremental Tube Construction for Human Action Detection

Harkirat Behl, Michael Sapienza|arXiv (Cornell University)|Apr 5, 2017
Human Pose and Action Recognition参考文献 32被引用 12
一句话总结

该论文提出OJLA,一种用于实时人体动作检测的在线、增量式算法,可在单次遍历中联合执行动作标注、时序定位和轨迹关联。通过构建统一的成本函数,OJLA在复杂、未修剪的视频中实现了更优的在线关联精度与速度(每帧1.8毫秒),优于当前最先进的离线与在线方法。

ABSTRACT

Current state-of-the-art action detection systems are tailored for offline batch-processing applications. However, for online applications like human-robot interaction, current systems fall short, either because they only detect one action per video, or because they assume that the entire video is available ahead of time. In this work, we introduce a real-time and online joint-labelling and association algorithm for action detection that can incrementally construct space-time action tubes on the most challenging action videos in which different action categories occur concurrently. In contrast to previous methods, we solve the detection-window association and action labelling problems jointly in a single pass. We demonstrate superior online association accuracy and speed (2.2ms per frame) as compared to the current state-of-the-art offline systems. We further demonstrate that the entire action detection pipeline can easily be made to work effectively in real-time using our action tube construction algorithm.

研究动机与目标

  • 解决当前动作检测系统依赖离线批量处理和多轮优化的局限性。
  • 为在线应用(如人机交互)提供实时、增量式处理能力。
  • 消除同一时空区域内存在不同标签的重叠或冲突动作轨迹。
  • 在单次统一优化过程中联合求解轨迹关联、时序定位与动作标注。
  • 在存在多个并发动作类别的复杂场景中提升准确率与处理速度。

提出的方法

  • 提出一种新颖的成本函数,可在单次遍历中联合优化轨迹关联、时序定位与动作标注。
  • 采用时空表示方法,确保任一空间区域在任意时刻最多分配一个动作标签,避免标签冲突。
  • 实现一种增量更新机制,随新帧到达即时处理,支持实时运行。
  • 利用双流CNN的帧级检测得分作为输入,指导轨迹构建。
  • 将问题建模为对动作轨迹的联合优化,确保非重叠、以人为核心的轨迹且标签一致。
  • 引入单次推理流水线,避免分离关联与标注步骤带来的冗余计算。

实验结果

研究问题

  • RQ1是否能在单次统一优化过程中有效解决在线动作检测中的轨迹关联、时序定位与标注问题?
  • RQ2与在线设置中顺序处理相比,联合优化在准确率与速度方面有何提升?
  • RQ3在每个时空区域内强制执行单标签分配在多大程度上减少了标签模糊性并提升了轨迹一致性?
  • RQ4所提方法在存在并发动作与多动作类别的复杂视频中是否保持高性能?
  • RQ5与多轮处理的SOTA方法相比,单次处理方法在速度与准确率方面表现如何?

主要发现

  • OJLA实现每帧1.8毫秒的推理速度,显著优于以往在线方法(如300–400fps),支持实时处理。
  • 在LIRIS-HARL等复杂数据集上,该方法在在线关联准确率方面优于当前最先进的离线与在线系统。
  • 在UCF-101与JHMDB-21数据集上(每时空区域仅存在一个动作),OJLA避免了标签冲突的重叠轨迹,提升了定性一致性。
  • 在多人多动作场景中,OJLA可生成非重叠、多标签的轨迹,支持并发动作检测。
  • 单次处理框架减少了计算冗余,在UCF-101上实现550fps的关联速度,优于以往方法的300–400fps。
  • 尽管在易样本数据集(UCF-101、JHMDB-21)中使用多标签可获得更高mAP,但OJLA的单标签方法在存在重叠动作的复杂真实场景中泛化能力更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。