Skip to main content
QUICK REVIEW

[论文解读] DenseRaC: Joint 3D Pose and Shape Estimation by Dense Render-and-Compare

Yuanlu Xu, Song‐Chun Zhu|arXiv (Cornell University)|Sep 30, 2019
Human Pose and Action Recognition参考文献 64被引用 16
一句话总结

DenseRaC 是一种用于单目 3D 人体姿态与体型估计的端到端框架,其使用像素到表面对应图(IUV)作为中间表示,并采用密集的渲染-对比损失以最小化输入图像与渲染输出之间的差异。通过利用大规模合成数据集(MOCA)并联合优化 3D 重建、关键点重投影、部件分割和对抗性损失,该方法在多个基准测试中实现了最先进性能。

ABSTRACT

We present DenseRaC, a novel end-to-end framework for jointly estimating 3D human pose and body shape from a monocular RGB image. Our two-step framework takes the body pixel-to-surface correspondence map (i.e., IUV map) as proxy representation and then performs estimation of parameterized human pose and shape. Specifically, given an estimated IUV map, we develop a deep neural network optimizing 3D body reconstruction losses and further integrating a render-and-compare scheme to minimize differences between the input and the rendered output, i.e., dense body landmarks, body part masks, and adversarial priors. To boost learning, we further construct a large-scale synthetic dataset (MOCA) utilizing web-crawled Mocap sequences, 3D scans and animations. The generated data covers diversified camera views, human actions and body shapes, and is paired with full ground truth. Our model jointly learns to represent the 3D human body from hybrid datasets, mitigating the problem of unpaired training data. Our experiments show that DenseRaC obtains superior performance against state of the art on public benchmarks of various humanrelated tasks.

研究动机与目标

  • 解决在有限监督下从单目 RGB 图像估计 3D 人体姿态与体型的挑战。
  • 通过使用密集的像素级表示,克服单目输入中的歧义、遮挡和纹理变化。
  • 通过引入 IUV 图和渲染-对比损失,减少对稀疏 2D/3D 关键点标注的依赖。
  • 利用大规模合成数据集(MOCA)提升鲁棒性与泛化能力,该数据集包含多样化的姿态、体型和相机视角。
  • 实现端到端学习,联合优化 3D 重建、姿态、体型和语义分割。

提出的方法

  • 采用两阶段框架:首先使用 DensePose-RCNN 从 RGB 图像中估计 IUV 图,然后从 IUV 图回归 3D 姿态与体型。
  • 引入一种可微分渲染器,生成包括 3D 关键点、身体部位掩码和渲染图像在内的密集输出。
  • 应用密集的渲染-对比损失,以最小化输入 RGB 图像与渲染输出之间的像素级差异。
  • 优化多个损失项:3D 重建损失(ℒ𝑟𝑟𝑟𝑟𝑟𝑟)、关键点重投影损失(ℒ𝑟𝑟𝑟𝑟𝑟𝑟)、部件分割损失(ℒ𝑚𝑚𝑚𝑚𝑚)以及针对不可能配置的对抗性损失(ℒ𝑎𝑎𝑎𝑎𝑎𝑎)。
  • 利用大规模合成数据集(MOCA)进行预训练和数据增强,该数据集由网络爬取的动捕序列、3D 扫描和动画生成。
  • 采用共享权重和端到端训练,联合回归 SMPL 参数(θ, β, α),同时强制执行几何与外观一致性。

实验结果

研究问题

  • RQ1与稀疏关键点监督相比,像 IUV 图这样的密集像素级表示是否能提升 3D 人体重建性能?
  • RQ2基于密集输出(关键点、掩码、渲染图像)的渲染-对比方案是否能带来更真实、更准确的 3D 重建?
  • RQ3合成数据(MOCA)在多大程度上能够缓解真实世界中成对或弱监督数据不足的问题?
  • RQ4不同损失组件(重建、重投影、分割、对抗性)对最终性能的贡献如何?
  • RQ5该框架在存在遮挡、多样服装和多人场景的野外图像中是否具备泛化能力?

主要发现

  • DenseRaC 在多个基准测试中均实现了 3D 姿态估计、语义身体分割和 3D 人体重建的最先进性能。
  • 在 H3.6M 基准测试中,DenseRaC 实现了 58.2 mm 的平均 MPVPE,优于 HMR 和其他 SOTA 方法。
  • 在 MOCA 合成数据集上,DenseRaC 实现了 48.7 mm 的平均 MPVPE,展现出强大的泛化能力与鲁棒性。
  • 消融研究证实,密集的渲染-对比损失相比稀疏关键点监督更能减少不合理的身体构型。
  • 定性结果表明,与 HMR、NBF 和 BodyNet 相比,DenseRaC 生成的 3D 人体更加自然且合理,尤其在遮挡和厚重衣物情况下表现更优。
  • 该方法通过在重建的 3D 人体上实现级联服装模拟,实现了有效的虚拟试穿,在视觉质量上优于端到端体素重建方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。