[论文解读] Textured Neural Avatars
本文提出了一种带有纹理的神经化身系统,通过显式建模二维纹理贴图并使用全卷积网络从3D关节位置和相机参数预测纹理坐标,学习在新姿势和相机视角下渲染人物的全身图像。该方法在训练数据有限的情况下,相比直接的图像到图像翻译方法,实现了更好的泛化能力和更真实的渲染效果。
We present a system for learning full-body neural avatars, i.e. deep networks that produce full-body renderings of a person for varying body pose and camera position. Our system takes the middle path between the classical graphics pipeline and the recent deep learning approaches that generate images of humans using image-to-image translation. In particular, our system estimates an explicit two-dimensional texture map of the model surface. At the same time, it abstains from explicit shape modeling in 3D. Instead, at test time, the system uses a fully-convolutional network to directly map the configuration of body feature points w.r.t. the camera to the 2D texture coordinates of individual pixels in the image frame. We show that such a system is capable of learning to generate realistic renderings while being trained on videos annotated with 3D poses and foreground masks. We also demonstrate that maintaining an explicit texture representation helps our system to achieve better generalization compared to systems that use direct image-to-image translation.
研究动机与目标
- 开发一种神经化身系统,能够在训练数据有限的情况下,对新姿势和相机视角具有良好的泛化能力。
- 通过显式建模二维纹理贴图,提升直接图像到图像翻译网络的泛化能力。
- 结合传统图形学(纹理解耦)与深度学习(端到端渲染)的优势。
- 实现在单目视频上进行训练,并仅用极少数据即可迁移到新个体。
- 在监督信息有限的情况下,展示在新视角和新姿势泛化上的鲁棒性与真实感。
提出的方法
- 该系统使用全卷积网络,基于3D关节位置和相机参数,为每个像素预测二维纹理坐标。
- 联合预测前景/背景掩码,并为身体表面维护显式的二维纹理贴图。
- 网络在带有3D姿态和前景掩码标注的视频上进行端到端训练,无需显式3D形状建模。
- 在为新个体微调时,纹理贴图从零开始初始化,从而实现仅从单个视频的零样本迁移。
- 该方法将几何与外观解耦,利用纹理作为先验,以提升在姿态和视角变化下的泛化能力。
- 采用可微分的渲染流水线,将预测的纹理坐标映射到最终图像像素。
实验结果
研究问题
- RQ1在仅使用有限单目视频数据训练的神经化身系统中,显式纹理表示能否提升泛化能力?
- RQ2与直接的视频到视频翻译相比,纹理感知的神经化身在新视角和新姿势泛化上的性能如何?
- RQ3在仅使用单个单目视频的情况下,神经化身在多大程度上可以迁移到新个体?
- RQ4与端到端图像到图像翻译相比,保持显式纹理贴图是否能减少伪影并提升真实感?
- RQ5当姿态估计存在误差时,尤其是手部和面部区域,该系统有多大的鲁棒性?
主要发现
- 我们的方法在SSIM指标上优于视频到视频(V2V)翻译,且在用户研究中更受青睐,表明其具有更好的感知质量和泛化能力。
- 在单视频迁移任务中,我们的方法在55%和65%的用户对比中优于V2V,证明了其强大的少样本泛化能力。
- 系统能够成功从单个YouTube视频生成合理的化身,尽管仍存在一些手部伪影。
- 定量评估显示SSIM表现更优,FID得分具有竞争力,但FID略逊于V2V,表明在指标与感知质量之间存在权衡。
- 当尺度与训练数据差异显著时,该方法泛化能力较差,表明其在尺度不变性方面存在局限。
- 在姿态估计误差下,伪影尤为明显,尤其是在手部和面部区域,凸显了对关键点精度的高度敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。