Skip to main content
QUICK REVIEW

[论文解读] ActionFlowNet: Learning Motion Representation for Action Recognition

Joe Yue-Hei Ng, Jonghyun Choi|arXiv (Cornell University)|Dec 9, 2016
Human Pose and Action Recognition参考文献 27被引用 9
一句话总结

ActionFlowNet 提出了一种多任务学习框架,通过单一流卷积神经网络直接从原始视频像素中联合训练动作识别与光流估计,无需外部预训练或光流输入,相比最先进无监督方法将动作识别准确率显著提升了 23.6%。该模型仅使用有限的标注数据,即可实现与 ImageNet 预训练模型相当的性能。

ABSTRACT

Even with the recent advances in convolutional neural networks (CNN) in various visual recognition tasks, the state-of-the-art action recognition system still relies on hand crafted motion feature such as optical flow to achieve the best performance. We propose a multitask learning model ActionFlowNet to train a single stream network directly from raw pixels to jointly estimate optical flow while recognizing actions with convolutional neural networks, capturing both appearance and motion in a single model. We additionally provide insights to how the quality of the learned optical flow affects the action recognition. Our model significantly improves action recognition accuracy by a large margin 31% compared to state-of-the-art CNN-based action recognition models trained without external large scale data and additional optical flow input. Without pretraining on large external labeled datasets, our model, by well exploiting the motion information, achieves competitive recognition accuracy to the models trained with large labeled datasets such as ImageNet and Sport-1M.

研究动机与目标

  • 通过最小化监督学习有效视频表征,解决动作识别中标注视频数据有限的挑战。
  • 克服仅分类训练的局限性,尽管使用大规模数据集,仍无法有效学习运动特征。
  • 通过在单一端到端网络中联合学习运动与外观表征,消除对手工设计光流输入的依赖。
  • 证明通过与光流估计联合进行多任务学习所学习到的运动表征,可在极少标注数据下显著提升动作识别准确率。

提出的方法

  • 提出一种单流 3D 卷积神经网络(ActionFlowNet),直接从原始视频帧中联合估计光流并执行动作识别。
  • 采用多任务学习,使用两种损失函数进行网络训练:用于动作分类的交叉熵损失和用于光流估计的 L2 损失。
  • 采用基于 ResNet 的架构并结合 3D 卷积,以建模时空特征,并在两项任务间共享特征。
  • 在仅使用动作标签进行监督的情况下,端到端地在原始像素上训练模型,同时将光流估计作为辅助任务以引导运动表征学习。
  • 通过在不同数据集(FlyingChairs 与 UCF101)上分别训练光流头,评估光流质量对识别性能的影响,并分析泛化能力。
  • 采用堆叠结构,固定光流分支,仅微调分类头,以隔离光流质量对识别性能的影响。

实验结果

研究问题

  • RQ1能否通过从原始像素中联合学习光流与动作识别,提升动作识别性能,而无需外部预训练?
  • RQ2所学习光流的质量如何影响下游动作识别准确率,特别是在标准基准上以 EPE 衡量时?
  • RQ3尽管 EPE 更高,但在小位移数据集(如 UCF101)上训练光流网络,是否比在大位移数据集(如 FlyingChairs)上训练能获得更好的动作识别性能?
  • RQ4从原始像素端到端学习运动表征,在多大程度上优于依赖手工设计光流或预训练特征的模型?

主要发现

  • ActionFlowNet 相比最先进无监督表示学习方法(不使用外部数据或光流输入),将动作识别准确率提升了 23.6%。
  • 该模型在 UCF101 上达到 69.6% 的 top-1 准确率,无需任何预训练,优于在 Sports-1M 上微调的 C3D 模型 1.6%。
  • 尽管端点误差(EPE)更高(11.84 vs. 9.12),在 UCF101 上训练光流估计的模型实现的识别准确率(69.6%)显著高于在 FlyingChairs 上训练的模型(51.7%),表明 EPE 等光流质量指标并不总与识别性能正相关。
  • 该模型在以运动为中心的动作(如 WallPushups 和 ApplyEyeMakeup)上表现最佳,因为这些动作的运动模式简单且具有判别性。
  • 即使使用高质量光流(如 EpicFlow,EPE=6.29),该模型的识别准确率(77.7%)仍低于直接在光流上训练的模型,表明端到端学习的光流质量存在局限性。
  • 定性分析显示,在 FlyingChairs 上训练的模型无法准确估计小位移,导致背景区域出现伪影,尽管 EPE 较低,但损害了识别性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。