Skip to main content
QUICK REVIEW

[论文解读] Action Recognition Based on Joint Trajectory Maps with Convolutional Neural Networks

Pichao Wang, Wanqing Li|arXiv (Cornell University)|Dec 30, 2016
Human Pose and Action Recognition被引用 8
一句话总结

本文提出联合轨迹图(Joint Trajectory Maps, JTM),一种将3D骨骼序列编码为三张2D彩色图像的方法,分别表示正交平面上的关节轨迹,从而实现对预训练卷积神经网络(ConvNets)的微调,用于人体动作识别。该方法在四个基准数据集(包括NTU RGB+D)上实现了最先进性能,通过利用互补的时空模式和分数融合实现。

ABSTRACT

Convolutional Neural Networks (ConvNets) have recently shown promising performance in many computer vision tasks, especially image-based recognition. How to effectively apply ConvNets to sequence-based data is still an open problem. This paper proposes an effective yet simple method to represent spatio-temporal information carried in $3D$ skeleton sequences into three $2D$ images by encoding the joint trajectories and their dynamics into color distribution in the images, referred to as Joint Trajectory Maps (JTM), and adopts ConvNets to learn the discriminative features for human action recognition. Such an image-based representation enables us to fine-tune existing ConvNets models for the classification of skeleton sequences without training the networks afresh. The three JTMs are generated in three orthogonal planes and provide complimentary information to each other. The final recognition is further improved through multiply score fusion of the three JTMs. The proposed method was evaluated on four public benchmark datasets, the large NTU RGB+D Dataset, MSRC-12 Kinect Gesture Dataset (MSRC-12), G3D Dataset and UTD Multimodal Human Action Dataset (UTD-MHAD) and achieved the state-of-the-art results.

研究动机与目标

  • 解决在基于深度学习的动作识别中,有效表示3D骨骼序列时空信息的挑战。
  • 实现在图像数据上预训练的卷积神经网络(ConvNets)无需从头训练即可用于骨骼序列分类。
  • 通过在三个正交平面上的互补表示和后期分数融合,提升识别准确率。
  • 通过使用旋转骨骼视图的数据增强方法,提升对视角变化的鲁棒性。
  • 证明基于图像的编码方式在传统序列建模或手工设计特征之上具有优越性。

提出的方法

  • 通过将3D关节轨迹投影到三个正交平面(如XY、XZ、YZ)生成联合轨迹图(JTM),将位置和运动动态编码为颜色强度。
  • 每张JTM使用颜色编码表示每个关节随时间的轨迹,形成保留空间与时间结构的纹理类模式。
  • 该方法对骨骼数据应用旋转增强,生成多个视角以模拟跨视角数据,提升泛化能力。
  • 在三张JTM图像上微调预训练的ImageNet卷积神经网络,以提取用于动作分类的判别性特征。
  • 通过在三个JTM视角上进行后期分数平均融合,提升鲁棒性与准确率。
  • 该方法通过利用图像表示的迁移学习,避免从头训练深层网络。

实验结果

研究问题

  • RQ13D骨骼序列能否被有效转换为保留时空动态的2D图像类表示,以供卷积神经网络处理?
  • RQ2使用三个正交JTM视角是否能提供互补信息,使动作识别性能超越单视角表示?
  • RQ3能否通过JTM输入,有效微调在自然图像上预训练的卷积神经网络,用于骨骼序列的动作识别?
  • RQ4通过骨骼旋转进行数据增强如何影响识别性能与视角泛化能力?
  • RQ5在多个JTM视角上融合分数是否能在多样化数据集上实现一致的性能提升?

主要发现

  • 所提方法在大规模NTU RGB+D数据集上实现了最先进准确率,优于使用相似输入模态的先前方法。
  • 在G3D数据集上,当融合九个视角(θ, ψ ∈ {-22.5°, 0°, 22.5°})时,识别准确率达到95.15%,使用25个视角未带来显著增益。
  • 自然坐标系(θ=0°, ψ=0°)在G3D上产生了最佳单视角准确率(95.12%),且各视角间差异极小。
  • 融合自然坐标系下三个正交JTMs的识别准确率高于单个视角,证明了互补信息的有效性。
  • 旋转增强有效提升了泛化能力,尤其在跨视角动作识别中表现突出,且无需显式建模视角变化。
  • 该方法在四个不同数据集(NTU RGB+D、MSRC-12、G3D和UTD-MHAD)上均表现优异,证实了其鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。