[论文解读] Unsupervised 3D Pose Estimation with Geometric Self-Supervision
该论文提出了一种无监督3D人体姿态估计方法,通过几何自监督机制将2D关节点坐标提升为3D,无需使用3D数据、2D-3D对应关系或3D先验。通过在提升、随机重投影和重新提升过程中强制一致性,该方法在Human3.6M数据集上相比先前无监督方法提升了30%,并在使用5%的3D数据进行微调后达到完全监督方法的性能水平。
We present an unsupervised learning approach to recover 3D human pose from 2D skeletal joints extracted from a single image. Our method does not require any multi-view image data, 3D skeletons, correspondences between 2D-3D points, or use previously learned 3D priors during training. A lifting network accepts 2D landmarks as inputs and generates a corresponding 3D skeleton estimate. During training, the recovered 3D skeleton is reprojected on random camera viewpoints to generate new "synthetic" 2D poses. By lifting the synthetic 2D poses back to 3D and re-projecting them in the original camera view, we can define self-consistency loss both in 3D and in 2D. The training can thus be self supervised by exploiting the geometric self-consistency of the lift-reproject-lift process. We show that self-consistency alone is not sufficient to generate realistic skeletons, however adding a 2D pose discriminator enables the lifter to output valid 3D poses. Additionally, to learn from 2D poses "in the wild", we train an unsupervised 2D domain adapter network to allow for an expansion of 2D data. This improves results and demonstrates the usefulness of 2D pose data for unsupervised 3D lifting. Results on Human3.6M dataset for 3D human pose estimation demonstrate that our approach improves upon the previous unsupervised methods by 30% and outperforms many weakly supervised approaches that explicitly use 3D data.
研究动机与目标
- 在无任何3D监督、3D先验或多视角数据的情况下,实现从2D关节点进行3D人体姿态估计。
- 基于不同随机相机视角下3D提升与重投影的几何一致性,开发一种自监督训练范式。
- 通过无监督领域自适应对2D关节点表征进行对齐,实现对多样化领域(如视频、图像)中2D姿态的泛化能力。
- 通过结合几何自监督与2D姿态判别器,提升3D姿态预测的鲁棒性与真实性。
- 证明仅使用2D数据的无监督3D提升方法可达到弱监督甚至完全监督方法的性能水平。
提出的方法
- 一个提升网络使用深度神经网络将2D关节点坐标映射为3D骨骼。
- 通过将3D骨骼重投影到随机相机视角以生成合成2D姿态,实现几何自监督。
- 将合成的2D姿态重新提升为3D,将结果与原始提升的3D骨骼进行比较,以计算自一致性损失。
- 训练一个2D姿态判别器以区分真实2D姿态与重投影生成的合成2D姿态,为提升3D输出的真实性提供反馈。
- 训练一个无监督的2D领域适配网络,以在无真实对应关系的情况下对齐不同数据集间的2D关节点分布。
- 通过时间判别器进一步利用时序一致性,以区分真实与伪造的姿态序列,当使用视频数据时可提升性能。
实验结果
研究问题
- RQ1仅通过几何一致性,能否在无任何3D监督的情况下,仅从2D关节点准确估计3D人体姿态?
- RQ2几何自监督是否足以生成真实感强的3D姿态,还是需要额外的正则化信号?
- RQ3能否在无监督条件下有效利用来自多样化来源(如视频、图像)的2D姿态数据进行3D提升?
- RQ4在无监督3D姿态估计器中引入视频序列的时间一致性,对性能有何影响?
- RQ5该模型能否在未见数据集(如MPII和LSP)上实现泛化,且在推理阶段无需任何3D标注?
主要发现
- 与先前无监督方法相比,该方法在Human3.6M数据集上的无监督3D姿态估计性能提升了30%,达到当前最先进水平。
- 当使用Human3.6M数据集中仅5%的3D数据进行微调时,该方法的平均关节点位置误差(MPJPE)达到37mm,与完全监督方法性能相当。
- 该模型能有效泛化到未见数据集(如MPII和LSP),在推理阶段无需任何3D真实值即可生成合理可信的3D姿态。
- 引入2D姿态判别器显著提升了生成3D姿态的真实性,因为仅靠几何自一致性不足以生成真实感输出。
- 通过时间判别器引入时序一致性后,性能额外提升了7%,即使在单帧推理时也有效。
- 使用领域适配器对来自多样化数据集(如Kinetics)的2D姿态进行对齐,显著扩展了训练数据多样性并提升了泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。