[论文解读] Skeletal Movement to Color Map: A Novel Representation for 3D Action Recognition with Inception Residual Networks
本文提出SPMF,一种新颖的骨骼表征方法,通过结合姿态与运动特征,将3D人体动作序列编码为彩色图像,从而利用深度Inception-Residual网络实现高效的3D动作识别。该方法在MSR Action3D(98.56%)和NTU-RGB+D(跨视角86.15%)上达到最先进准确率,且计算成本低于先前方法。
We propose a novel skeleton-based representation for 3D action recognition in videos using Deep Convolutional Neural Networks (D-CNNs). Two key issues have been addressed: First, how to construct a robust representation that easily captures the spatial-temporal evolutions of motions from skeleton sequences. Second, how to design D-CNNs capable of learning discriminative features from the new representation in a effective manner. To address these tasks, a skeletonbased representation, namely, SPMF (Skeleton Pose-Motion Feature) is proposed. The SPMFs are built from two of the most important properties of a human action: postures and their motions. Therefore, they are able to effectively represent complex actions. For learning and recognition tasks, we design and optimize new D-CNNs based on the idea of Inception Residual networks to predict actions from SPMFs. Our method is evaluated on two challenging datasets including MSR Action3D and NTU-RGB+D. Experimental results indicated that the proposed method surpasses state-of-the-art methods whilst requiring less computation.
研究动机与目标
- 为解决从骨骼序列中表征3D人体动作复杂时空动态的挑战。
- 设计一种深度学习框架,能够有效从新型图像化骨骼表征中学习判别性特征。
- 在提升动作识别准确率的同时,相比现有方法降低计算复杂度。
- 首次探索将非常深的Inception-ResNet架构应用于基于骨骼的动作识别的可行性。
提出的方法
- 通过计算帧间3D骨骼关节点之间的欧氏距离(JJD)构建SPMF,以捕捉姿态与运动特征。
- 姿态特征(PFs)源自静态关节点距离,而运动特征(MFs)则通过这些距离在连续帧间的时序差分计算得出。
- SPMF表征将这些特征映射为2D彩色图像,其中空间布局编码关节点配置,时序演化通过颜色强度变化编码。
- 采用基于Inception-ResNet架构的定制深度学习框架,从SPMF图像中端到端提取层次化特征并进行动作分类。
- 网络采用残差连接和Inception模块,以改善深层网络中的梯度流动与特征学习。
- 训练采用He初始化,Adam优化器配合余弦退火学习率调度,并在较小数据集(如MSR Action3D)上应用数据增强。
实验结果
研究问题
- RQ1能否设计一种统一表征,将3D骨骼中的静态姿态与动态运动特征有效结合,以编码复杂的人体动作?
- RQ2与传统RNN或手工设计特征相比,深度Inception-ResNet网络是否能更有效地从SPMF编码的彩色图像中学习判别性特征?
- RQ3与最先进方法相比,所提出的SPMF表征是否在提升识别准确率的同时降低计算成本?
- RQ4所提出方法在不同评估协议(如基准数据集上的跨主体与跨视角设置)下是否具备良好的泛化能力?
主要发现
- SPMF Inception-ResNet-222模型在MSR Action3D数据集上达到98.56%的平均准确率,超越所有先前最先进方法。
- 在NTU-RGB+D数据集上,该方法在跨视角评估协议中达到86.15%的准确率,创下新最先进水平。
- 在NTU-RGB+D数据集的跨主体评估中,模型达到78.89%的准确率,显著优于先前方法。
- 单个GPU上,训练时间为每序列1.85×10⁻³秒,推理时间为每序列0.128秒,证明具备实时可行性。
- 中间特征可视化显示,网络能从SPMF输入中学习到空间与时间上一致的表征。
- 消融实验证实,SPMF中同时结合姿态与运动特征相比仅使用单一特征类型,性能更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。