[论文解读] ActionXPose: A Novel 2D Multi-view Pose-based Algorithm for Real-time Human Action Recognition
ActionXPose 是一种实时、基于2D多视角姿态的人体动作识别算法,利用 OpenPose 检测到的身体关键点,并结合一维卷积神经网络(1D-CNN)与长短期记忆网络(LSTM)进行分类。该方法在 i3DPost 和 KTH 等姿态级别动作识别数据集上达到最先进性能,展现出在多个数据集间的强泛化能力,对视角变化、相机运动及主体距离变化具有鲁棒性。
We present ActionXPose, a novel 2D pose-based algorithm for posture-level Human Action Recognition (HAR). The proposed approach exploits 2D human poses provided by OpenPose detector from RGB videos. ActionXPose aims to process poses data to be provided to a Long Short-Term Memory Neural Network and to a 1D Convolutional Neural Network, which solve the classification problem. ActionXPose is one of the first algorithms that exploits 2D human poses for HAR. The algorithm has real-time performance and it is robust to camera movings, subject proximity changes, viewpoint changes, subject appearance changes and provide high generalization degree. In fact, extensive simulations show that ActionXPose can be successfully trained using different datasets at once. State-of-the-art performance on popular datasets for posture-related HAR problems (i3DPost, KTH) are provided and results are compared with those obtained by other methods, including the selected ActionXPose baseline. Moreover, we also proposed two novel datasets called MPOSE and ISLD recorded in our Intelligent Sensing Lab, to show ActionXPose generalization performance.
研究动机与目标
- 开发一种新颖的基于2D多视角姿态的实时人体动作识别算法,仅使用 RGB 视频输入。
- 通过在多个姿态级别数据集上联合训练,提升模型在多样化数据集间的泛化能力。
- 实现对视角变化、相机运动、主体距离变化及外观变化的鲁棒性。
- 引入两个新数据集 MPOSE 和 ISLD,用于评估在非受限录制条件下模型的泛化性能。
- 在仅使用最少输入数据(14个身体关键点)的前提下,于标准姿态级别 HAR 基准测试中实现最先进性能。
提出的方法
- 使用 OpenPose 从 RGB 视频帧中提取 2D 身体关节坐标(14个关键点)作为输入特征。
- 应用预处理流程对姿态序列进行归一化,以补偿相机运动、变焦及主体距离变化的影响。
- 将归一化后的姿态序列输入一维卷积神经网络(1D-CNN),以提取时空特征。
- 将 1D-CNN 提取的特征与长短期记忆网络(LSTM)结合,以建模动作序列中的长程时序依赖关系。
- 采用端到端训练策略,支持在多个数据集(包括 MPOSE 和 ISLD)上联合学习。
- 利用 LSTM 处理可变长度输入序列的能力,实现无需固定长度约束的灵活时序建模。
实验结果
研究问题
- RQ1基于姿态的方法是否能仅使用 RGB 视频中的 2D 身体关键点,在姿态级别人体动作识别任务中实现最先进性能?
- RQ2ActionXPose 在具有不同视角、录制条件与动作风格的多个数据集之间,其泛化能力达到何种程度?
- RQ3所提出的预处理方法在减轻相机运动、变焦及主体距离变化影响方面的有效性如何?
- RQ4在多个数据集上进行联合训练是否能提升模型在未见数据上的泛化能力与性能?
- RQ5ActionXPose 在标准数据集与新引入数据集上,相较于基线方法与现有最先进方法的表现如何?
主要发现
- ActionXPose 在 i3DPost 和 KTH 数据集上达到最先进性能,优于 OpenPose 基线及其他现有方法。
- 该模型在多个数据集(包括 MPOSE 和 ISLD)上表现出有效泛化能力,显示出对视角、相机运动及主体距离变化的高鲁棒性。
- 即使仅以 14 个身体关键点坐标作为输入,ActionXPose 仍能实现高精度,表明其能从极简姿态数据中有效学习特征。
- 该模型可处理可变长度序列(MPOSE 中为 15 至 358 个时间步),证实其灵活性与适用于实时及在线动作检测的适用性。
- 从 MPOSE 到 ISLD 的迁移学习表现出性能下降,归因于动作执行风格的差异,提示领域泛化能力仍有提升空间。
- ActionXPose 可实现实时运行,性能主要受限于 OpenPose 姿态检测器,证实其在真实世界监控与交互应用中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。