Skip to main content
QUICK REVIEW

[论文解读] Actionness Estimation Using Hybrid Fully Convolutional Networks

Limin Wang, Yu Qiao|arXiv (Cornell University)|Apr 25, 2016
Human Pose and Action Recognition参考文献 46被引用 21
一句话总结

该论文提出了一种混合全卷积网络(H-FCN),通过分别处理外观(A-FCN)和运动(M-FCN)全卷积流,融合外观与运动线索,实现动作性估计。该方法在Stanford40、UCF Sports和JHMDB数据集上达到最先进性能,仅需每帧4–10个提议即可在0.5 IoU阈值下实现0.9的召回率,显著提升了动作提议生成与动作检测性能。

ABSTRACT

Actionness was introduced to quantify the likelihood of containing a generic action instance at a specific location. Accurate and efficient estimation of actionness is important in video analysis and may benefit other relevant tasks such as action recognition and action detection. This paper presents a new deep architecture for actionness estimation, called hybrid fully convolutional network (H-FCN), which is composed of appearance FCN (A-FCN) and motion FCN (M-FCN). These two FCNs leverage the strong capacity of deep models to estimate actionness maps from the perspectives of static appearance and dynamic motion, respectively. In addition, the fully convolutional nature of H-FCN allows it to efficiently process videos with arbitrary sizes. Experiments are conducted on the challenging datasets of Stanford40, UCF Sports, and JHMDB to verify the effectiveness of H-FCN on actionness estimation, which demonstrate that our method achieves superior performance to previous ones. Moreover, we apply the estimated actionness maps on action proposal generation and action detection. Our actionness maps advance the current state-of-the-art performance of these tasks substantially.

研究动机与目标

  • 解决现有动作分类方法在视频中无法准确定位动作的局限性。
  • 通过高效生成高质量动作提议来提升动作检测性能,避免计算成本高昂的滑动窗口方法。
  • 开发一种统一的深度学习框架,利用全卷积结构实现任意输入尺寸的动作性图估计。
  • 证明动作性图可作为动作检测与识别等下游任务的有效特征。

提出的方法

  • H-FCN架构结合两个全卷积网络:A-FCN处理RGB帧以提取静态外观特征,M-FCN处理光流场以捕捉时间运动动态。
  • A-FCN与M-FCN分别使用ImageNet和UCF101预训练模型进行初始化,并在动作性估计任务上端到端微调。
  • 将A-FCN与M-FCN生成的动作性图进行融合,生成综合置信图,指示每个空间位置存在动作的可能性。
  • 全卷积设计使网络可处理任意分辨率的视频帧,无需固定输入尺寸约束。
  • 通过在估计的动作性图上进行阈值处理与非极大值抑制,生成动作提议。
  • 该方法在类似RCNN的检测框架中进行评估,将动作提议作为区域候选用于动作分类。

实验结果

研究问题

  • RQ1能否通过在统一的深度学习框架中结合外观与运动线索,有效估计动作性?
  • RQ2与现有动作性估计方法相比,所提出的H-FCN在定位准确率与效率方面表现如何?
  • RQ3估计的动作性图在真实世界视频数据集上,能在多大程度上提升动作提议生成与动作检测性能?
  • RQ4融合外观与运动特征是否优于仅使用单一模态?

主要发现

  • 在Stanford40数据集上,该方法仅需每张图像10个动作提议即可在0.5 IoU阈值下实现0.9的召回率,优于L-CORF与物体性方法。
  • 在JHMDB数据集上,该方法在0.7 IoU阈值下仅用每帧10个提议即可实现0.5–0.6的检测率,展现出强大的定位准确率。
  • A-FCN与M-FCN的结合优于单一流,且在JHMDB上A-FCN表现优于M-FCN。
  • 在视频数据集上,该方法大幅超越近期的STODP动作提议方法。
  • 在动作检测中,该方法相较最先进方法[11]将帧级AP与视频级AP分别提升约3%,在使用时序链接进行管级检测时更实现15%的显著提升。
  • 动作性图显著减少了所需提议数量,同时保持高召回率,证明其在下游视频理解任务中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。