[论文解读] Back to Optimization: Diffusion-based Zero-Shot 3D Human Pose Estimation
本文提出 ZeDO,一种零样本 3D 人体姿态估计框架,通过将预训练的基于扩散模型的 3D 姿态生成模型与迭代优化流程相结合,以最小化 2D 关键点重投影误差。通过在优化循环中将扩散模型用作去噪正则化器,ZeDO 在 Human3.6M(最小 MPJPE 51.4 mm)和 3DPW(PA-MPJPE 40.3 mm)上实现了最先进性能,且无需任何 2D-3D 或图像-3D 训练配对数据。
Learning-based methods have dominated the 3D human pose estimation (HPE) tasks with significantly better performance in most benchmarks than traditional optimization-based methods. Nonetheless, 3D HPE in the wild is still the biggest challenge for learning-based models, whether with 2D-3D lifting, image-to-3D, or diffusion-based methods, since the trained networks implicitly learn camera intrinsic parameters and domain-based 3D human pose distributions and estimate poses by statistical average. On the other hand, the optimization-based methods estimate results case-by-case, which can predict more diverse and sophisticated human poses in the wild. By combining the advantages of optimization-based and learning-based methods, we propose the extbf{Ze}ro-shot extbf{D}iffusion-based extbf{O}ptimization ( extbf{ZeDO}) pipeline for 3D HPE to solve the problem of cross-domain and in-the-wild 3D HPE. Our multi-hypothesis extit{ extbf{ZeDO}} achieves state-of-the-art (SOTA) performance on Human3.6M, with minMPJPE $51.4$mm, without training with any 2D-3D or image-3D pairs. Moreover, our single-hypothesis extit{ extbf{ZeDO}} achieves SOTA performance on 3DPW dataset with PA-MPJPE $40.3$mm on cross-dataset evaluation, which even outperforms learning-based methods trained on 3DPW.
研究动机与目标
- 解决基于学习的 3D HPE 方法在跨域和真实场景中因领域特定分布和相机参数偏差导致的局限性。
- 通过将预训练的扩散模型整合到迭代优化流程中,弥合基于优化与基于学习方法之间的性能差距。
- 在无需任何 2D-3D 或图像-3D 训练配对数据的情况下实现零样本 3D HPE,实现在不同数据集间的强大泛化能力。
- 通过解耦相机内参并利用推理过程中基于扩散的姿势先验,提升对多样化姿态和相机配置的鲁棒性。
提出的方法
- 将预训练的基于扩散的 3D 人体姿态生成模型作为去噪先验,集成到迭代优化循环中。
- 使用简单的 3D HPE 优化流程,通过调整 3D 姿态参数和位移来最小化 2D 关键点重投影误差。
- 应用迭代优化:优化器更新 3D 姿态,扩散模型对姿态进行去噪,以施加现实的人体结构约束。
- 采用初始姿态优化器,旋转并校准初始 3D 姿态以匹配 2D 关键点,从而提升初始化质量。
- 利用 K-Means 聚类对训练姿态进行聚类,选取具有代表性的锚点姿态用于初始化,优于随机采样或生成方法。
- 在扩散模型预训练期间应用旋转和翻转数据增强,以提升在不同数据集上的泛化能力。
实验结果
研究问题
- RQ1未经微调,预训练的扩散模型能否在优化循环中有效重用于作为可微分正则化器进行 3D HPE?
- RQ2将迭代优化与基于扩散的去噪相结合,如何提升在未见领域上的零样本 3D HPE 性能?
- RQ3初始姿态初始化与数据增强对优化流程鲁棒性与准确性的具体影响是什么?
- RQ4基于优化的方法结合扩散先验,在跨数据集评估中,能在多大程度上超越端到端的基于学习的模型?
- RQ5哪些关键超参数(如迭代次数、采样策略)会影响推理质量与速度?
主要发现
- ZeDO 在 Human3.6M 数据集上实现了最先进零样本性能,最小 MPJPE 为 51.4 mm,且无需任何 2D-3D 或图像-3D 训练配对数据。
- 在 3DPW 数据集上,ZeDO 在跨数据集评估中实现了 PA-MPJPE 40.3 mm,优于在 3DPW 上微调的基于学习的模型。
- 初始姿态优化器在 Human3.6M 上将 MPJPE 降低 9.3 mm(S=1),最小 MPJPE 降低 2.0 mm(S=50),在更复杂的 3DHP 数据集上提升更显著。
- 在扩散模型预训练期间进行数据增强,使 MPJPE 在跨域性能上提升 13.9 mm,证明其在泛化中的关键作用。
- 使用混合数据集(Human3.6M + 3DHP)进行扩散模型预训练,使 ZeDO 在 Human3.6M 上性能提升 1.3 mm,在 3DHP 上提升 2.8 mm。
- 最优迭代次数约为 1000 次,性能在此之后趋于稳定,进一步增加迭代次数不会提升性能,但会降低推理速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。