Skip to main content
QUICK REVIEW

[论文解读] Thin-Slicing Network: A Deep Structured Model for Pose Estimation in Videos

Jie Song, Limin Wang|arXiv (Cornell University)|Mar 31, 2017
Human Pose and Action Recognition参考文献 38被引用 13
一句话总结

本文提出了一种名为Thin-Slicing Network的深度结构化模型,将时空推理整合到全卷积网络中,用于基于视频的人体姿态估计。通过利用密集光流进行时序特征传播,并在环状时空图上执行消息传递,该模型在遮挡、运动模糊和罕见姿态情况下提升了关节点检测的准确性,在Penn Action和JHMDB数据集上实现了最先进性能,相较于之前的方法,平均PCK指标提升了4.7%。

ABSTRACT

Deep ConvNets have been shown to be effective for the task of human pose estimation from single images. However, several challenging issues arise in the video-based case such as self-occlusion, motion blur, and uncommon poses with few or no examples in training data sets. Temporal information can provide additional cues about the location of body joints and help to alleviate these issues. In this paper, we propose a deep structured model to estimate a sequence of human poses in unconstrained videos. This model can be efficiently trained in an end-to-end manner and is capable of representing appearance of body joints and their spatio-temporal relationships simultaneously. Domain knowledge about the human body is explicitly incorporated into the network providing effective priors to regularize the skeletal structure and to enforce temporal consistency. The proposed end-to-end architecture is evaluated on two widely used benchmarks (Penn Action dataset and JHMDB dataset) for video-based pose estimation. Our approach significantly outperforms the existing state-of-the-art methods.

研究动机与目标

  • 为解决基于视频的人体姿态估计中的挑战,如自遮挡、运动模糊和非常见姿态,这些因素会降低单图方法的性能。
  • 利用非约束视频序列中的时序一致性,提升关节点定位精度,超越仅依赖空间先验的可能性。
  • 开发一种可端到端训练的架构,联合优化深层外观特征与结构化时空关系。
  • 通过环状图结构隐式引入人体运动学的领域知识,而不依赖显式的运动先验。

提出的方法

  • 该模型使用全卷积网络从输入视频帧回归初始关节点热力图。
  • 在相邻帧之间计算密集光流,以时序方式扭曲预测的热力图,使其与当前帧对齐。
  • 提出一种新型时空推理层,在环状图的时空边(空间连接与帧间连接)上执行迭代消息传递。
  • 通过结构化预测框架,在空间和时间上强制一致性,从而降低关节点位置的不确定性。
  • 整个架构采用端到端训练,允许反向传播同时优化卷积网络回归器与结构化推理组件。
  • 该方法显式将人体骨骼建模为具有空间约束和时序传播的图结构,从而增强对瞬时视觉退化情况的鲁棒性。

实验结果

研究问题

  • RQ1与基于图像的基线方法相比,端到端学习时空结构化模型是否能提升非约束视频中姿态估计的准确性?
  • RQ2在环状时空图上执行消息传递,在降低遮挡或模糊关节点的不确定性方面有多有效?
  • RQ3通过光流传播获得的时序一致性,在检测罕见或模糊姿态方面能提升多少?
  • RQ4联合优化外观回归器与结构化推理层是否能带来比分开训练更好的泛化性能?

主要发现

  • Thin-Slicing Network在Penn Action数据集上的平均PCK得分相比之前最先进方法绝对提升了4.7%。
  • 在JHMDB数据集上,该模型实现了92.1%的平均PCK@0.2得分,优于所有先前方法,包括使用手工特征或循环网络的方法。
  • 该方法在腕部和踝部等困难关节点上显著提升性能,在Penn Action数据集上踝部的平均PCK提升了10.4%。
  • 即使在无遮挡或模糊的简单情况下,该模型仍通过多帧一致性提升了精度,表明联合优化有助于提升一元预测性能。
  • 失败案例主要源于长时间的运动模糊或遮挡,表明更长范围的时序建模可进一步提升鲁棒性。
  • 消融实验确认,空间与时间推理(ST-infer)的组合性能最高,优于仅空间推理(S-infer)和基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。