Skip to main content
QUICK REVIEW

[论文解读] 3D Pose Detection in Videos: Focusing on Occlusion

Justin Wang, Edward Xu|arXiv (Cornell University)|Jun 24, 2020
Human Pose and Action Recognition参考文献 8被引用 4
一句话总结

该论文提出了一种两阶段的3D人体姿态估计框架,通过将遮挡感知的时间卷积网络(TCNs)与自底向上堆叠沙漏网络生成的2D姿态预测相结合,提升了视频中被遮挡关节的估计精度。通过引入一种改进的圆柱体人体模型用于遮挡标注,并使用修改后的损失函数显式训练TCN识别被遮挡关节,该方法相比线性基线模型降低了5 mm的平均每关节位置误差(MPJPE),相比仅使用TCN的基线模型也降低了0.1 mm,同时降低了计算成本。

ABSTRACT

In this work, we build upon existing methods for occlusion-aware 3D pose detection in videos. We implement a two stage architecture that consists of the stacked hourglass network to produce 2D pose predictions, which are then inputted into a temporal convolutional network to produce 3D pose predictions. To facilitate prediction on poses with occluded joints, we introduce an intuitive generalization of the cylinder man model used to generate occlusion labels. We find that the occlusion-aware network is able to achieve a mean-per-joint-position error 5 mm less than our linear baseline model on the Human3.6M dataset. Compared to our temporal convolutional network baseline, we achieve a comparable mean-per-joint-position error of 0.1 mm less at reduced computational cost.

研究动机与目标

  • 提升视频中3D人体姿态估计的精度,特别是针对因自遮挡或物体遮挡而难以检测的被遮挡关节。
  • 通过引入时间上下文和显式的遮挡信号,解决现有3D姿态估计模型在遮挡条件下泛化能力差的问题。
  • 通过改进圆柱体人体模型启发式方法,生成更精确的遮挡标签,从而构建更鲁棒且高效的遮挡建模策略。
  • 训练一种时间卷积网络(TCN),使其同时利用2D姿态预测和遮挡状态,实现更准确的3D姿态估计,优于线性基线和标准TCN基线。

提出的方法

  • 该方法使用堆叠沙漏网络从视频帧中生成2D关键点预测,作为主3D姿态估计流程的输入。
  • 通过改进的圆柱体人体模型启发式方法生成遮挡标签,该方法将3D真实关键点投影到2D平面,并根据其在相机视角下的可见性判断关节是否被遮挡。
  • 核心模型为时间卷积网络(TCN),其输入为2D关节坐标和遮挡向量,目标是预测连续帧中的3D关节位置。
  • TCN采用修改后的损失函数进行训练,显式引入真实遮挡标签,使模型能够更有效地学习对被遮挡关节的推理能力。
  • 该框架在Human3.6M和HumanEva-I数据集上进行评估,消融实验对比了不同的遮挡建模策略和网络变体。
  • 引入了一种聚类遮挡启发式方法,作为基线高斯模型的替代方案,提升了泛化能力并减少了对特定遮挡模式的过拟合。

实验结果

研究问题

  • RQ1与标准基线相比,使用显式遮挡信号进行训练的时间卷积网络(TCN)是否能提升视频序列中被遮挡关节的3D姿态估计精度?
  • RQ2所提出的遮挡感知TCN在平均每关节位置误差(MPJPE)方面,与线性回归基线和标准TCN基线相比表现如何?
  • RQ3对圆柱体人体模型启发式方法进行改进以生成遮挡标签,能在多大程度上提升模型在关节被遮挡时预测3D姿态的能力?
  • RQ4在损失函数中引入真实遮挡标签进行监督训练,是否能提升模型在被遮挡关节上的泛化能力并降低误差?
  • RQ5简化版的遮挡启发式方法(如聚类遮挡模型)是否能在降低计算开销的同时,实现与更复杂启发式方法相当或更优的性能?

主要发现

  • 在Human3.6M数据集上,遮挡感知TCN的平均每关节位置误差(MPJPE)为23.01 mm,相比线性基线模型降低了5 mm。
  • 与标准TCN基线相比,所提方法在计算成本更低的情况下,实现了0.1 mm更低的MPJPE。
  • 使用改进的圆柱体人体模型进行遮挡标注显著提升了模型性能,尤其在“SittingDown”等关节遮挡频繁的动作中表现突出。
  • 聚类遮挡启发式方法(更宽松地标记关节为遮挡)优于基线高斯遮挡模型,通过鼓励模型在不同遮挡模式间泛化,提升了模型鲁棒性。
  • 由于有效利用了时间上下文和遮挡信号,该模型在“SittingDown”动作中表现出色,该动作中髋关节常被膝盖遮挡。
  • 尽管存在计算资源限制,当使用遮挡向量而非热图时,该模型在Human3.6M上的测试误差仍达到50.36 mm,表明该方法在资源受限条件下依然具有可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。