Skip to main content
QUICK REVIEW

[论文解读] DAP3D-Net: Where, What and How Actions Occur in Videos?

Li Liu, Yi Zhou|arXiv (Cornell University)|Feb 10, 2016
Human Pose and Action Recognition参考文献 56被引用 6
一句话总结

该论文提出DAP3D-Net,一种多任务3D卷积神经网络,可联合执行视频中的动作定位、分类和分层运动属性学习。通过在新构建的大规模合成数据集(NASA)上利用外观和光流输入,并在真实世界数据集(HAU)上进行评估,DAP3D-Net在动作检测和属性预测方面达到最先进性能,定位准确率提升3.4%–5.3%,属性学习的AUC最高提升34.2%。

ABSTRACT

Action parsing in videos with complex scenes is an interesting but challenging task in computer vision. In this paper, we propose a generic 3D convolutional neural network in a multi-task learning manner for effective Deep Action Parsing (DAP3D-Net) in videos. Particularly, in the training phase, action localization, classification and attributes learning can be jointly optimized on our appearancemotion data via DAP3D-Net. For an upcoming test video, we can describe each individual action in the video simultaneously as: Where the action occurs, What the action is and How the action is performed. To well demonstrate the effectiveness of the proposed DAP3D-Net, we also contribute a new Numerous-category Aligned Synthetic Action dataset, i.e., NASA, which consists of 200; 000 action clips of more than 300 categories and with 33 pre-defined action attributes in two hierarchical levels (i.e., low-level attributes of basic body part movements and high-level attributes related to action motion). We learn DAP3D-Net using the NASA dataset and then evaluate it on our collected Human Action Understanding (HAU) dataset. Experimental results show that our approach can accurately localize, categorize and describe multiple actions in realistic videos.

研究动机与目标

  • 为解决复杂视频动作解析的挑战,联合求解动作定位、分类和运动属性学习问题。
  • 开发一个统一的深度学习框架,以建模定位、分类和属性描述之间的相互依赖关系。
  • 构建一个大规模、标注完善的合成数据集(NASA),包含超过300个类别和33种分层属性的20万个视频片段,用于模型训练。
  • 在具有真实标注位置、类别和属性的现实人类动作理解数据集(HAU)上评估模型性能。
  • 证明使用3D CNN的多任务学习方法在性能上优于单任务或独立学习方法。

提出的方法

  • DAP3D-Net采用3D卷积神经网络架构,同时输入外观(RGB)和运动(光流)特征,以实现时空建模。
  • 通过联合优化三个分支实现多任务学习:动作定位(边界框回归)、动作分类(Softmax)和分层属性预测(H1:低层级身体部位运动;H2:高层级运动模式)。
  • 采用两级分层属性学习机制,低层级和高层级属性分别从不同全连接层(FC1 和 FC2)预测,以提升表征学习能力。
  • 网络通过联合损失函数进行端到端训练,该损失函数结合了分类损失、定位损失和属性预测损失。
  • 通过在HAU数据集上微调网络,应用迁移学习,利用预训练C3D模型的特征。
  • 后处理包括通过边界框回归器(BBR)优化边界框,以及对提取特征进行可选的SVM分类,用于性能对比。

实验结果

研究问题

  • RQ1统一的深度学习框架能否有效解决复杂视频场景中动作定位、分类和运动属性学习这三个相互关联的问题?
  • RQ2在3D CNN架构中采用联合多任务学习,相较于单任务或独立学习,在动作解析性能上表现如何?
  • RQ3与仅使用外观输入相比,使用光流作为运动输入在动作定位和属性预测方面能带来多大程度的性能提升?
  • RQ4所提出的分层属性学习方案(H1和H2)相较于从单一全连接层学习全部33个属性,效果如何?
  • RQ5该模型能否在真实世界视频中实现良好泛化,并在动作检测和属性预测任务上超越最先进方法?

主要发现

  • 经过微调的DAP3D-Net(DAP3D-Net 2 + Ft)在HAU数据集上使用Softmax分类器时,平均精度均值(mAP)达到70.6%,优于使用线性SVM的基线方法。
  • 引入边界框回归器(BBR)后,动作检测的mAP相比未使用BBR的DAP3D-Net提升了3.4%至5.3%。
  • DAP3D-Net 2 + Ft在低层级属性(H1)的AUC上较基线方法提升32.5%,在高层级属性(H2)上提升达34.2%。
  • 分层属性学习方案(H1和H2分别从FC1和FC2预测)优于从单一全连接层(如FC2)学习全部33个属性,表现为更高的AUC和命中率(H1为17/19,H2为12/14)。
  • 在DAP3D-Net 2提取的特征上使用线性SVM可使mAP提升1%,但总检测时间增至每600帧视频158.67秒,因此端到端Softmax方法更具效率。
  • 定性结果(图8)表明,该模型能准确生成动作定位边界框,同时实现动作类别和运动属性的联合预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。