Skip to main content
QUICK REVIEW

[论文解读] Pose-Based Two-Stream Relational Networks for Action Recognition in Videos

Wei Wang, Jinjin Zhang|arXiv (Cornell University)|May 22, 2018
Human Pose and Action Recognition参考文献 32被引用 7
一句话总结

该论文提出了一种基于姿态的双流关系网络(PSRN),联合建模2D人体姿态动态与与动作相关的物体,用于视频动作识别。通过在姿态-物体关系网络中采用多损失监督,融合姿态序列与物体特征,PSRN在Sub-JHMDB(80.2%)和PennAction(98.1%)上实现了最先进性能,通过显式建模人-物交互,显著优于先前方法。

ABSTRACT

Recently, pose-based action recognition has gained more and more attention due to the better performance compared with traditional appearance-based methods. However, there still exist two problems to be further solved. First, existing pose-based methods generally recognize human actions with captured 3D human poses which are very difficult to obtain in real scenarios. Second, few pose-based methods model the action-related objects in recognizing human-object interaction actions in which objects play an important role. To solve the problems above, we propose a pose-based two-stream relational network (PSRN) for action recognition. In PSRN, one stream models the temporal dynamics of the targeted 2D human pose sequences which are directly extracted from raw videos, and the other stream models the action-related objects from a randomly sampled video frame. Most importantly, instead of fusing two-streams in the class score layer as before, we propose a pose-object relational network to model the relationship between human poses and action-related objects. We evaluate the proposed PSRN on two challenging benchmarks, i.e., Sub-JHMDB and PennAction. Experimental results show that our PSRN obtains the state-the-of-art performance on Sub-JHMDB (80.2%) and PennAction (98.1%). Our work opens a new door to action recognition by combining 2D human pose extracted from raw video and image appearance.

研究动机与目标

  • 解决基于姿态的动作识别方法在真实场景中依赖难以获取的3D姿态的局限性。
  • 克服现有基于姿态的方法中对与动作相关物体的忽视,而这些物体在人-物交互识别中至关重要。
  • 提出一种合理的融合策略,建模人体姿态与相关物体之间的关系,而非在分类层进行后期融合。
  • 仅使用原始视频中的2D姿态估计和空间外观特征,实现高效的动作识别,提升实用性和性能。

提出的方法

  • 使用改进的OpenPose模型从视频帧中提取多人2D姿态,然后应用注意力机制选择目标人物的姿态。
  • 使用两个独立的双向LSTM-RNN分别建模姿态位置和姿态速度,捕捉时间运动模式。
  • 从随机采样的视频帧中使用预训练的VGG16网络提取空间物体特征,以表示与动作相关的物体。
  • 构建姿态-物体关系网络,通过将物体特征图的每一列视为候选物体,将LSTM输出的姿态表示与物体特征图进行融合。
  • 通过将每个物体候选与姿态隐藏状态h^L_T和h^V_T结合,计算关系特征R,实现姿态-物体交互的联合建模。
  • 通过三种分类损失监督模型:一个作用于姿态位置LSTM,一个作用于姿态速度LSTM,一个作用于最终的关系特征R,实现端到端学习并提升特征表示能力。

实验结果

研究问题

  • RQ1与仅使用姿态或仅使用外观的基线方法相比,结合2D姿态序列与空间物体特征的双流网络是否能提升动作识别性能?
  • RQ2建模人体姿态与与动作相关物体之间的关系交互是否能带来更好的泛化能力并减少误分类,尤其是对视觉外观相似的动作?
  • RQ3在最终分类层之前运行的关系融合机制是否能优于传统双流网络中的后期融合策略?
  • RQ4与使用3D姿态相比,仅使用从原始视频中估计的2D姿态在性能和真实场景中的实际部署方面影响如何?
  • RQ5所提出的多损失监督策略在提升姿态动态与姿态-物体关系学习方面的有效性如何?

主要发现

  • PSRN在Sub-JHMDB上达到80.2%的top-1准确率,实现最先进性能,显著优于先前方法(如RPAN的78.6%)。
  • 在更具挑战性的PennAction数据集上,PSRN达到98.1%的准确率,显著优于RPAN(97.4%),并将误分类数从31例减少至20例。
  • 消融实验证实,双向LSTM与注意力机制的结合显著提升了姿态表征学习能力,完整PSRN模型(bi-LSTM + attention)在Sub-JHMDB上达到83.7%,在PennAction上达到98.1%。
  • 姿态-物体关系网络至关重要:加入关系模块的双流融合优于所有其他流融合变体,证明其在建模交互方面的有效性。
  • 混淆矩阵分析表明,PSRN减少了视觉外观相似动作之间的误分类(如tennis_forehand与tennis_serve,以及squat与bench_press),表明其对动作动态与物体上下文的建模更优。
  • 模型性能提升在涉及特定物体的动作中最为显著——如bench_press、squat和网球类动作——证实了与物体关系建模的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。