[论文解读] Photorealistic Monocular 3D Reconstruction of Humans Wearing Clothing
PHORHUM 提出了一种端到端的深度学习框架,用于从单张RGB图像实现穿着衣物的人体的逼真单目3D重建,联合预测详细的符号距离场几何、反照率、阴影和场景光照。通过引入基于图像块的渲染损失,该方法显著提升了可见区域和自遮挡区域的感知色彩保真度,且无需图像抠图或多阶段流水线,实现了最先进性能。
We present PHORHUM, a novel, end-to-end trainable, deep neural network methodology for photorealistic 3D human reconstruction given just a monocular RGB image. Our pixel-aligned method estimates detailed 3D geometry and, for the first time, the unshaded surface color together with the scene illumination. Observing that 3D supervision alone is not sufficient for high fidelity color reconstruction, we introduce patch-based rendering losses that enable reliable color reconstruction on visible parts of the human, and detailed and plausible color estimation for the non-visible parts. Moreover, our method specifically addresses methodological and practical limitations of prior work in terms of representing geometry, albedo, and illumination effects, in an end-to-end model where factors can be effectively disentangled. In extensive experiments, we demonstrate the versatility and robustness of our approach. Our state-of-the-art results validate the method qualitatively and for different metrics, for both geometric and color reconstruction.
研究动机与目标
- 解决缺乏可端到端训练的方法联合从单张单目RGB图像预测几何、反照率和阴影的问题。
- 克服先前方法将阴影烘焙到外观中的局限性,使模型不适合真实场景的集成。
- 消除对图像抠图或多阶段流水线的依赖,实现单步推理。
- 通过新型渲染损失提升重建色彩的视觉保真度,尤其在非可见(自遮挡)区域。
- 实现几何、反照率和光照的解耦,以提升在虚拟试穿或场景合成等下游应用中的灵活性。
提出的方法
- 该方法使用一个单一、可端到端训练的神经网络,用于预测3D几何的符号距离场、表面反照率和场景光照。
- 引入基于图像块的渲染损失,基于光度一致性监督颜色外观,从而提升感知质量。
- 网络联合估计表面法线、反照率和阴影,实现光照效应与固有表面颜色的解耦。
- 通过在学习到的符号距离场上应用Marching Cubes算法提取网格,并采用八叉树采样实现高效高分辨率重建。
- 模型以64³个体素为一批处理输入图像,V100 GPU上256³网格的推理时间为1.21秒,512³网格为5.72秒。
- 后处理包括通过拟合2D关键点检测结果,使用ICP对齐将网格与GHUM统计人体模型进行绑定。
实验结果
研究问题
- RQ1能否通过一个单一的、端到端的深度学习模型,无需图像抠图,从单张RGB图像联合预测出详细的3D几何、反照率和阴影?
- RQ2渲染损失如何提升颜色重建的感知质量,尤其是在自遮挡区域?
- RQ3几何与外观的联合优化是否能相比顺序或多阶段方法,实现更好的反照率与光照解耦?
- RQ4缺乏显式的2D监督(如图像抠图)是否会导致性能下降,且模型能否泛化到多样化的背景和光照条件?
- RQ5在几何精度和逼真外观方面,该方法与最先进方法相比,在定性和定量上表现如何?
主要发现
- PHORHUM在几何和色彩重建方面均达到最先进性能,在PeopleSnapshot数据集上优于PIFuHD和Tex2Shape。
- 该方法生成了合理的反照率和阴影估计,支持逼真的重新光照和新场景中的合成。
- 渲染损失显著提升了视觉保真度,尤其在非可见区域,这些区域的颜色估计原本不可靠。
- 网格重建在V100 GPU上256³网格耗时1.21秒,512³网格耗时5.72秒,高分辨率网格最多包含40万个人工智能顶点。
- 尽管未在该类数据上显式训练,模型在具有纯白背景的图像上也表现出良好的泛化能力。
- 通过GHUM进行后处理绑定,使重建网格能够使用标准动作捕捉数据或潜在姿态采样进行动画处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。