[论文解读] DeepSkeleton: Skeleton Map for 3D Human Pose Regression
本文提出 DeepSkeleton,一种新颖的骨骼图表示方法,可直接从中间特征实现 3D 人体姿态回归,无需融合 RGB 或 3D 数据。通过反卷积生成多尺度、多裁剪的骨骼图,该方法实现了最先进性能——在 Human3.6M 上达到 86.5 毫米平均误差,在 MPII 上达到 74.8% PCKh@0.5,证明仅靠骨骼图即可有效解决深度模糊性问题,并优于直接的 RGB 回归。
Despite recent success on 2D human pose estimation, 3D human pose estimation still remains an open problem. A key challenge is the ill-posed depth ambiguity nature. This paper presents a novel intermediate feature representation named skeleton map for regression. It distills structural context from irrelavant properties of RGB image e.g. illumination and texture. It is simple, clean and can be easily generated via deconvolution network. For the first time, we show that training regression network from skeleton map alone is capable of meeting the performance of state-of-theart 3D human pose estimation works. We further exploit the power of multiple 3D hypothesis generation to obtain reasonbale 3D pose in consistent with 2D pose detection. The effectiveness of our approach is validated on challenging in-the-wild dataset MPII and indoor dataset Human3.6M.
研究动机与目标
- 为解决 3D 人体姿态估计中的病态深度模糊性问题,提出一种紧凑且结构化的中间表示。
- 证明仅从骨骼图直接进行 3D 姿态回归即可达到或超越当前最先进性能,且无需依赖 3D 监督或数据融合。
- 通过多尺度和多裁剪骨骼图生成解决深度模糊性问题,隐式实现数据增强。
- 将人体部位分割、2D 姿态估计与 3D 回归统一到一个框架中,即 DeepSkeleton。
- 通过在真实骨骼图上评估,建立基于骨骼图回归的性能上限。
提出的方法
- 提出一种轻量级、通过反卷积生成的中间特征骨骼图,仅编码关节连接信息,不包含纹理或光照信息。
- 通过输入图像的多尺度和多裁剪增强生成多个骨骼图,支持多假设回归。
- 使用反卷积网络从 RGB 图像生成骨骼图,保留结构信息与遮挡感知能力。
- 采用单一回归头直接从骨骼图预测 3D 关节坐标,避免复杂优化或 2D 到 3D 提升阶段。
- 应用多尺度和多裁剪策略生成多样化的语义特征,提升对遮挡和视角变化的鲁棒性。
- 将分割、2D 姿态检测与 3D 回归整合到统一框架 DeepSkeleton 中。
实验结果
研究问题
- RQ1是否可以仅使用骨骼图表示实现有效的 3D 人体姿态估计,而无需 RGB-3D 数据融合?
- RQ2从多个骨骼图生成多假设是否能提升在具有挑战性的野外数据集上的性能?
- RQ3基于骨骼图的回归性能与直接从 RGB 图像回归相比如何?
- RQ4当使用真实骨骼图时,基于骨骼图表示的性能上限是多少?
- RQ5仅靠骨骼图是否能够解决 3D 姿态估计中的深度模糊性问题?
主要发现
- 从单个预测的骨骼图直接回归,将 MPII 上的 PCKh@0.5 平均值从 61.8%(RGB 基线)提升至 71.2%,相对提升 9.4%。
- 使用多尺度和多裁剪骨骼图后,MPII 上的 PCKh@0.5 平均值提升至 74.8%,证明多假设生成带来显著增益。
- 踝部 PCKh@0.5 提升 16.4%(相对提升 24.2%),表明对遮挡和尺度变化具有更强鲁棒性。
- 从真实骨骼图回归在 MPII 上达到 94.5% 的 PCKh@0.5 平均值,表明骨骼图表示极为有效,且预测与真实之间的性能差距较小。
- 在 Human3.6M 上实现 86.5 毫米平均关节误差,与无需 3D 监督或后处理的最先进回归方法持平。
- 单一骨骼图的多个回归集成性能劣于多假设系统,证明多层级骨骼图捕捉了超越简单模型平均的多样化语义特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。