[论文解读] Predicting Camera Viewpoint Improves Cross-dataset Generalization for 3D Human Pose Estimation
本文提出将相对于以人体为中心的坐标系的相机视角预测作为辅助任务,以提升单目3D人体姿态估计在跨数据集场景下的泛化能力。通过仅使用现有的关节点坐标,联合预测3D姿态与相机视角,该方法减少了对数据集特异性相机分布的过拟合,在五个基准数据集上均实现了最先进性能,相较于局部聚类基线方法,MPJPE指标提升了3.4 mm。
Monocular estimation of 3d human pose has attracted increased attention with the availability of large ground-truth motion capture datasets. However, the diversity of training data available is limited and it is not clear to what extent methods generalize outside the specific datasets they are trained on. In this work we carry out a systematic study of the diversity and biases present in specific datasets and its effect on cross-dataset generalization across a compendium of 5 pose datasets. We specifically focus on systematic differences in the distribution of camera viewpoints relative to a body-centered coordinate frame. Based on this observation, we propose an auxiliary task of predicting the camera viewpoint in addition to pose. We find that models trained to jointly predict viewpoint and pose systematically show significantly improved cross-dataset generalization.
研究动机与目标
- 调查现有3D人体姿态数据集中系统性偏差,特别是相对于人体的相机视角分布差异。
- 解决由于数据集特异性偏差导致的3D姿态估计跨数据集泛化能力差的问题。
- 提出一种新颖的辅助任务——相机视角预测,以提升模型鲁棒性,且无需额外标注。
- 证明视角预测可提升在多样化数据集上的泛化能力,同时在单个数据集上保持或提升性能。
提出的方法
- 该方法引入一个辅助的视角预测分支,用于估计相机中心坐标系与人体中心坐标系之间的相对旋转。
- 通过基于躯干向量的相机方向进行k-means聚类,从真实3D关节点坐标中推导出相机视角。
- 模型使用分类头进行离散视角预测(基于四元数),并使用回归头进行连续视角估计。
- 最终的姿态预测在相机中心坐标系中进行,而视角预测则通过交叉熵损失和回归损失进行训练。
- 通过在现成的3D姿态模型(如PoseNet)上添加视角头,将该方法应用于实际模型,实现端到端联合优化。
- 该方法无需新增标注,因为视角标签可直接从现有的3D关节点数据中计算得出。
实验结果
研究问题
- RQ1不同3D人体姿态数据集中相机视角分布的系统性差异如何影响跨数据集泛化?
- RQ2相对于人体中心坐标系预测相机视角,能否减少对特定数据集偏差的过拟合?
- RQ3将视角预测作为辅助任务,是否能提升在多样化数据集上的3D姿态估计性能?
- RQ4视角表示方式的选择(分类与回归)对性能有何影响?
- RQ5视角预测能否在不增加额外标注或领域自适应的前提下提升泛化能力?
主要发现
- 所提方法在全部五个基准数据集上均达到SOTA的MPJPE性能:H36M(52.0 mm)、GPA(53.3 mm)、SURREAL(37.1 mm)、3DPW(89.7 mm)和3DHP(90.3 mm)。
- 与使用每数据集局部聚类进行视角表示的基线相比,该模型将MPJPE降低了3.4 mm。
- 采用k=100的k-means聚类可获得最佳性能,且在多个k值下MPJPE与最优配置的差距在6 mm以内。
- 与仅使用回归的视角预测相比,基于四元数的分类方法将误差降低了4.3 mm。
- 添加标准姿态预测分支并未提升性能,表明其在提升泛化能力方面不如视角预测有效。
- 该方法实现了强大的跨数据集泛化能力:在H36M上预训练的模型在自身数据集上表现最佳,并在视角分布差异最大的3DHP数据集上显著优于基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。