Skip to main content
QUICK REVIEW

[论文解读] Skeleton-based Action Recognition of People Handling Objects

Sunoh Kim, Kimin Yun|arXiv (Cornell University)|Jan 21, 2019
Human Pose and Action Recognition参考文献 37被引用 9
一句话总结

该论文提出OHA-GCN,一种图卷积网络框架,通过利用骨骼数据建模人体姿态图与与物体相关的人体姿态图,实现对与物体相关的人体动作的识别。通过选择高置信度帧并结合姿态估计与背景减除技术整合物体姿态,该方法实现了实时性能,并在基准数据集和自定义数据集(包括非法垃圾倾倒数据集)上优于当前最先进的基于骨骼的动作识别方法。

ABSTRACT

In visual surveillance systems, it is necessary to recognize the behavior of people handling objects such as a phone, a cup, or a plastic bag. In this paper, to address this problem, we propose a new framework for recognizing object-related human actions by graph convolutional networks using human and object poses. In this framework, we construct skeletal graphs of reliable human poses by selectively sampling the informative frames in a video, which include human joints with high confidence scores obtained in pose estimation. The skeletal graphs generated from the sampled frames represent human poses related to the object position in both the spatial and temporal domains, and these graphs are used as inputs to the graph convolutional networks. Through experiments over an open benchmark and our own data sets, we verify the validity of our framework in that our method outperforms the state-of-the-art method for skeleton-based action recognition.

研究动机与目标

  • 解决在姿态估计易出错且常被忽略上下文物体信息的非约束监控环境中识别与物体相关的人体动作的挑战。
  • 通过将物体姿态整合到图表示中,改进基于骨骼的动作识别,增强对人-物交互的上下文理解。
  • 开发一种实时、鲁棒的框架,通过信息性帧选择与双流GCN架构处理不准确的姿态估计与模糊帧。
  • 在公开基准数据集与新收集的现实非约束场景下非法垃圾倾倒数据集上验证该框架。

提出的方法

  • 该框架利用姿态估计与背景减除技术,从人体与物体姿态构建骨骼图,节点代表关节点与物体位置。
  • 采用帧选择策略,基于姿态置信度分数,每段视频选取一个高置信度帧,以减少噪声与模糊性。
  • 构建两类图:(1) 人体姿态图,用于捕捉人体在时空中的运动;(2) 与物体相关的人体姿态图,用于建模人-物之间的时空关系。
  • 采用双流GCN架构,独立处理两类图,通过图卷积操作节点及其邻接节点,提取时空特征。
  • 通过融合双流的特征输出最终预测,实现对人体运动与人-物交互的联合建模。
  • 系统使用OpenPose进行姿态估计,并通过匈牙利匹配实现跟踪,以在多人场景中分离个体参与者。

实验结果

研究问题

  • RQ1将物体姿态整合到骨骼图中,能否提升在非约束环境中对与物体相关的人体动作的识别性能?
  • RQ2基于姿态置信度分数的信息性帧选择策略,如何影响基于骨骼的动作识别的鲁棒性与性能?
  • RQ3处理人体姿态图与与物体相关的人体姿态图的双流GCN框架,是否能比单流方法取得更高的准确率?
  • RQ4该框架在完整监控流水线中部署时,其实时性能如何?

主要发现

  • OHA-GCN在ICVL-4数据集上达到91.86%的准确率,优于当前最先进的ST-GCN方法(准确率为80.23%)。
  • 该方法运行速度约为每秒3571帧,显著快于基于RGB的CNN(如ResNet50,每帧耗时17.26 ms)。
  • 整个流水线(包括姿态估计与GCN推理)平均耗时94.78 ms/帧(约10.6 FPS),证明其在实时监控系统中的可行性。
  • 采用信息性帧选择显著提升了模型鲁棒性,减少了低置信度或模糊姿态在训练与推理阶段的影响。
  • 所提出的非法垃圾倾倒(IRD)数据集提供了真实、非约束的视频数据,可用于评估现实场景中与物体相关动作识别的表现。
  • 双流GCN架构(结合人体姿态图与与物体相关的人体姿态图)性能最高,表明显式建模人-物交互具有重要价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。