[论文解读] Towards Robust RGB-D Human Mesh Recovery
本文提出了一种基于动态数据融合模块、通用SMPL约束生成器(USCG)和深度排序一致性(DRC)损失的鲁棒RGB-D人体网格恢复方法,以提升深度模糊性分辨率。该方法通过利用相对深度排序和合成SMPL监督信号,实现了在具有不同标注的多样化RGB-D与RGB-only数据集上的统一训练,从而在网格重建精度方面达到最先进水平。
We consider the problem of human pose estimation. While much recent work has focused on the RGB domain, these techniques are inherently under-constrained since there can be many 3D configurations that explain the same 2D projection. To this end, we propose a new method that uses RGB-D data to estimate a parametric human mesh model. Our key innovations include (a) the design of a new dynamic data fusion module that facilitates learning with a combination of RGB-only and RGB-D datasets, (b) a new constraint generator module that provides SMPL supervisory signals when explicit SMPL annotations are not available, and (c) the design of a new depth ranking learning objective, all of which enable principled model training with RGB-D data. We conduct extensive experiments on a variety of RGB-D datasets to demonstrate efficacy.
研究动机与目标
- 通过利用RGB-D传感器提供的深度数据,解决仅RGB输入下人体网格恢复中的固有深度模糊性问题。
- 实现仅提供2D关键点、SMPL标注或完全无SMPL标签的异构数据集的联合训练。
- 开发一种统一的训练框架,即使在缺失或不一致的数据情况下,也能在RGB-only、深度-only和RGB-D输入之间实现泛化。
- 通过约束生成器,从任意坐标系下的3D关键点标注中生成可靠的SMPL监督信号。
- 通过学习关键点之间的相对深度排序,强制预测网格参数的深度一致性。
提出的方法
- 引入一种动态数据融合模块,在训练期间随机激活RGB或深度流,从而提升对缺失模态数据的鲁棒性。
- 采用概率性训练策略,模拟RGB或深度输入的缺失,提升在不同数据可用性场景下的泛化能力。
- 提出通用SMPL约束生成器(USCG),可从相对3D关键点配置中推断SMPL参数,且与坐标系无关。
- 设计一种深度排序一致性(DRC)损失,强制预测3D关键点的正确相对深度排序,提升深度感知的网格估计性能。
- 通过USCG结合SMPL监督与标准2D关键点损失,联合训练统一模型,以处理混合数据集。
- 使用零值填充的深度图,将仅RGB数据集(如PKU-MMD)适配为与RGB-D数据联合训练,实现高效数据利用。
实验结果
研究问题
- RQ1当RGB-D数据在数据集中不完全可用或未对齐时,如何有效训练人体网格估计器?
- RQ2如何从坐标系各异或缺失的3D关键点标注中生成可靠的SMPL监督信号?
- RQ3如何在无显式SMPL标注的情况下,强制实现网格预测的深度一致性?
- RQ4在混合RGB与RGB-D数据集上联合训练的统一模型,是否优于仅在单一数据类型上训练的模型?
- RQ5深度排序监督对不同输入模态下的网格重建精度有何影响?
主要发现
- 所提模型在PKU-MMD数据集的RGB-D输入上,平均顶点到真实值误差为130.70,仅使用DRC损失后降低至120.90。
- 通过USCG引入辅助SMPL损失后,所有输入类型和数据集的平均重建误差降低8.5%。
- 与仅RGB数据集(如PKU-MMD)联合训练后,PKU-MMD的RGB-D输入误差从120.59降至110.47,证明了数据效率。
- 在PKU-MMD和CAD-60上联合训练并使用USCG与DRC的模型,优于仅在单一数据集上训练的基线模型,展现出跨数据集泛化能力。
- 仅使用DRC损失时,CAD-60 RGB-D输入的误差降低9.8%(从102.45降至91.04),证明其在处理坐标系差异方面的有效性。
- USCG与DRC损失联合使用时性能最佳,与基线相比,CAD-60 RGB-D输入的误差降低12.4%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。