[论文解读] DRPose3D: Depth Ranking in 3D Human Pose Estimation
DRPose3D 提出了一种两阶段的3D人体姿态估计方法,通过利用深度排序——学习关节之间的成对深度顺序——作为几何先验,以提升3D姿态回归性能。通过使用成对排序卷积神经网络(PRCNN)预测深度排序,并利用自粗到精的3D姿态网络(DPNet)将结果与2D关节点结合,该方法在Human3.6M数据集上实现了最先进性能,将MPJPE降低至57.8mm(Protocol #1)、42.9mm(Protocol #2)和62.8mm(Protocol #3),并将Protocol #1与#3之间的差距减少了59.7%。
In this paper, we propose a two-stage depth ranking based method (DRPose3D) to tackle the problem of 3D human pose estimation. Instead of accurate 3D positions, the depth ranking can be identified by human intuitively and learned using the deep neural network more easily by solving classification problems. Moreover, depth ranking contains rich 3D information. It prevents the 2D-to-3D pose regression in two-stage methods from being ill-posed. In our method, firstly, we design a Pairwise Ranking Convolutional Neural Network (PRCNN) to extract depth rankings of human joints from images. Secondly, a coarse-to-fine 3D Pose Network(DPNet) is proposed to estimate 3D poses from both depth rankings and 2D human joint locations. Additionally, to improve the generality of our model, we introduce a statistical method to augment depth rankings. Our approach outperforms the state-of-the-art methods in the Human3.6M benchmark for all three testing protocols, indicating that depth ranking is an essential geometric feature which can be learned to improve the 3D pose estimation.
研究动机与目标
- 通过引入深度排序作为可学习的几何先验,解决两阶段方法中2D到3D姿态回归的病态问题。
- 通过利用编码在深度排序中的丰富3D结构信息,提升3D姿态估计精度,该信息比绝对3D坐标更直观、更易学习。
- 通过在3D空间中合成虚拟相机视角并施加统计噪声于深度排序,实现有效的数据增强,提升模型泛化能力。
- 证明深度排序是一种鲁棒、可学习且可增强的几何特征,能显著提升3D姿态估计性能。
提出的方法
- 设计了一种成对排序卷积神经网络(PRCNN),通过将问题视为一系列二分类任务,预测所有关节点对之间的深度排序,生成深度关系矩阵。
- PRCNN以RGB图像和2D热力图特征作为输入,采用类似Siamese的网络结构比较关节点对,输出某一关节点在z轴方向是否位于另一关节点前方。
- 提出一种自粗到精的3D姿态网络(DPNet),由DepthNet和PoseNet组成,其中DepthNet首先根据多数深度排序估计粗略的深度值,随后在微调阶段进一步优化3D姿态。
- 为提升泛化能力,引入一种统计数据增强方法,通过合成3D姿态和相机参数,从虚拟视角生成逼真的2D关节点位置和深度排序矩阵。
- 采用环绕主体的圆形相机采样策略,模拟多样化视角,同时向排序矩阵添加噪声,使其匹配真实数据分布。
- 最终通过结合2D关节点位置和深度排序矩阵回归3D姿态,DPNet有效降低了排序预测中的噪声。
实验结果
研究问题
- RQ1在2D到3D姿态估计中,深度排序是否比直接回归3D坐标更具鲁棒性和可学习性?
- RQ2在两阶段3D姿态估计模型中,引入深度排序如何提升性能与泛化能力?
- RQ3能否在3D空间中利用深度排序实现有效的数据增强?其是否能增强模型对未见相机视角的鲁棒性?
- RQ4DPNet中的自粗到精细化过程在多大程度上降低了噪声深度排序预测的影响?
- RQ5从单张图像学习深度排序是否能带来比端到端或标准两阶段方法更好的3D姿态估计性能?
主要发现
- DRPose3D在Human3.6M基准测试的全部三个协议上均达到最先进性能,Protocol #1的MPJPE为57.8mm,Protocol #2为42.9mm,Protocol #3为62.8mm。
- 该方法将Protocol #1与Protocol #3之间的MPJPE差距从104.7mm减少至仅5.0mm,表明对新型相机视角具有极强的鲁棒性。
- 移除深度排序后,MPJPE上升至68.1mm,证明深度排序显著提升了3D姿态估计的准确性。
- 与直接从噪声排序中回归相比,自粗到精的DPNet设计使误差降低了3.2mm,证明其在噪声抑制方面的有效性。
- 与非增强训练相比,深度排序的统计数据增强使性能提升2.1mm,证实其在泛化中的价值。
- 当使用ResNet-34时,PRCNN在Protocol #1上的平均准确率达到91.22%,肩部等关节点对的准确率高达96.71%,表明深度关系预测具有高度可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。