Skip to main content
QUICK REVIEW

[论文解读] Real-time Human Pose Estimation from Video with Convolutional Neural Networks

Marko Linna, Kannala, Juho|arXiv (Cornell University)|Sep 23, 2016
Human Pose and Action Recognition参考文献 29被引用 7
一句话总结

本文提出了一种基于两阶段深度学习方法的实时多人姿态估计系统:首先在多样化公开数据集上进行预训练,随后在通过Kinect收集的应用特定数据上进行微调。该方法在PCK@0.2指标下达到96.8%的准确率,单次前向传播耗时16ms,使其成为在姿态和背景变化有限的受限环境中进行手势控制、游戏和动作识别的快速、高精度替代方案,可替代Kinect。

ABSTRACT

In this paper, we present a method for real-time multi-person human pose estimation from video by utilizing convolutional neural networks. Our method is aimed for use case specific applications, where good accuracy is essential and variation of the background and poses is limited. This enables us to use a generic network architecture, which is both accurate and fast. We divide the problem into two phases: (1) pre-training and (2) finetuning. In pre-training, the network is learned with highly diverse input data from publicly available datasets, while in finetuning we train with application specific data, which we record with Kinect. Our method differs from most of the state-of-the-art methods in that we consider the whole system, including person detector, pose estimator and an automatic way to record application specific training material for finetuning. Our method is considerably faster than many of the state-of-the-art methods. Our method can be thought of as a replacement for Kinect, and it can be used for higher level tasks, such as gesture control, games, person tracking, action recognition and action tracking. We achieved accuracy of 96.8\% (PCK@0.2) with application specific data.

研究动机与目标

  • 开发一种针对受限环境和姿态/背景变化有限的应用场景,具有高效率和高准确率的人体姿态估计系统。
  • 用基于深度学习的系统替代Kinect,支持实时运行及更高阶任务,如手势控制和动作识别。
  • 通过Kinect自动实现大规模数据收集,以高效标注训练数据,支持微调。
  • 通过集成独立的人体检测器,实现对输入图像中个体的定位和裁剪,从而支持多人姿态估计。
  • 处理异构训练数据,其中样本间的关节点集合存在差异,从而支持在训练中整合多样化数据集。

提出的方法

  • 该方法首先使用通用的八层卷积神经网络架构,在多样化公开数据集上进行预训练。
  • 随后利用通过Kinect收集的应用特定数据对网络进行微调,这些数据提供了真实世界视频序列中精确的3D关节点标注。
  • 通过独立的人体检测器对输入图像中的个体进行定位和裁剪,从而在无需事先知晓人物位置的情况下实现多人姿态估计。
  • 系统利用Kinect的深度和RGB数据,自动生成大规模、弱监督的训练数据,包含精确的2D和3D关节点标注。
  • 网络被训练以处理样本间可变的关节点集合,从而支持整合关节点标注不同的数据集。
  • 前向传播推理时间在不包含人体检测器时为16ms,在包含时为76–216ms,实际应用中可实现实时性能。

实验结果

研究问题

  • RQ1两阶段CNN方法(预训练后微调)是否能在受限的、用例特定的姿态估计任务中实现高准确率和实时性能?
  • RQ2与仅使用通用预训练相比,使用应用特定数据进行微调在多大程度上提升了姿态估计的准确率?
  • RQ3Kinect是否能有效用于在真实场景中自动生成大规模、高精度的训练数据,以支持微调?
  • RQ4人体检测器的集成如何影响在非受限视频输入中多人姿态估计的实际可行性和可扩展性?
  • RQ5在姿态估计性能中,泛化能力(在多样化数据上)与特定性(在领域特定数据上)之间存在何种权衡?

主要发现

  • 在完成全部微调后,该方法在用例特定数据上的准确率达到96.8%(PCK@0.2),证明了其高度的实际可用性。
  • 手腕关节点的估计准确率从预训练时的24.5%显著提升至完全微调后的89.2%,凸显了领域特定数据对关键关节点的显著优势。
  • 在预训练验证集上的准确率从63.1%下降至44.2%(微调后),表明泛化能力与特定性之间存在权衡。
  • 系统保持了16ms的前向传播时间,实现了实时性能,适用于手势控制和游戏等交互式应用。
  • 利用Kinect进行自动数据收集,可高效生成大规模、高精度的训练数据集,无需人工标注。
  • 在受限环境中,该方法优于通用姿态估计模型,表明针对特定用例的微调可超越通用模型在特定场景下的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。