[论文解读] Digital Twin: Acquiring High-Fidelity 3D Avatar from a Single Image
本文提出了一种半监督深度学习方法,仅需单张图像即可生成高保真度的3D形象,并配以高分辨率UV纹理图。通过使用预训练的深度面部身份特征,在合成渲染的、逼真的面部图像上训练形状回归网络,该方法在真实世界自拍图像上实现了卓越的泛化能力和准确性,生成适用于移动设备的3D模型,具备清晰的面部细节和逼真的外观。
We present an approach to generate high fidelity 3D face avatar with a high-resolution UV texture map from a single image. To estimate the face geometry, we use a deep neural network to directly predict vertex coordinates of the 3D face model from the given image. The 3D face geometry is further refined by a non-rigid deformation process to more accurately capture facial landmarks before texture projection. A key novelty of our approach is to train the shape regression network on facial images synthetically generated using a high-quality rendering engine. Moreover, our shape estimator fully leverages the discriminative power of deep facial identity features learned from millions of facial images. We have conducted extensive experiments to demonstrate the superiority of our optimized 2D-to-3D rendering approach, especially its excellent generalization property on real-world selfie images. Our proposed system of rendering 3D avatars from 2D images has a wide range of applications from virtual/augmented reality (VR/AR) and telepsychiatry to human-computer interaction and social networks.
研究动机与目标
- 自动化从单张2D图像创建高保真度3D形象,减少对人工3D扫描或艺术家工作的依赖。
- 通过利用合成的逼真面部图像,解决2D到3D重建中的固有模糊性,实现稳健的形状估计。
- 通过结合深度身份特征与非刚性形变及高分辨率UV映射,提升纹理真实感和几何精度。
- 通过低多边形几何结构与高分辨率纹理投射,实现在移动设备上的实时高效渲染。
提出的方法
- 使用从数百万张图像中提取的深度面部身份特征,训练深度神经网络,直接从单张图像回归3D人脸模型的顶点坐标。
- 形状估计器在大规模合成逼真面部图像数据集上进行训练,这些图像通过高保真渲染引擎,基于482个中性3D人脸扫描生成。
- 应用非刚性形变,通过联合优化相机参数、头部姿态、面部表情以及每个顶点的校正场,以提升关键点定位精度。
- 将高分辨率UV纹理图投射到优化后的3D网格上,以保留皮肤纹理和精细几何结构等细微面部特征。
- 系统利用预训练的身份特征,增强形状泛化能力,从而实现对非约束自拍图像的精确重建。
- 最终的3D形象模型采用低多边形基础网格与高分辨率UV纹理,实现移动平台上的高效实时渲染。
实验结果
研究问题
- RQ1在合成逼真图像上训练的深度学习模型,能否有效泛化到真实世界自拍图像,实现高质量的3D人脸重建?
- RQ2利用预训练的深度面部身份特征,在单图像3D形象生成中,如何提升形状估计的准确性和泛化能力?
- RQ3对顶点坐标的非刚性优化在多大程度上提升了关键点定位精度和纹理投射质量?
- RQ4系统能否在保持低多边形数量以实现移动设备渲染效率的同时,生成具有高分辨率纹理的高保真3D形象?
主要发现
- 与PRNet、RingNet和3DMM-CNN等最先进方法相比,该方法在基准数据集上实现了更高的形状相似度和更优的纹理分辨率。
- 该模型在真实世界自拍图像上表现出极强的泛化能力,对光照、姿态和面部表情的变化具有显著鲁棒性。
- 使用合成逼真训练数据显著提升了性能,优于在简单或不真实感强的合成数据上训练的方法。
- 由于采用低多边形基础几何结构与高分辨率UV纹理映射,最终的3D形象模型支持在移动设备上实时渲染。
- 系统通过将动画混合形状(blendshapes)映射到重建模型上,实现了高质量的音频驱动唇部同步,展现出可投入实际应用的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。