[论文解读] Detailed Human Avatars from Monocular Video
本文提出了一种新颖的方法,通过整合面部关键点检测、从明暗恢复形状(shape-from-shading)以及语义感知的纹理拼接策略,仅从单张单目视频中创建高度详细且身份特征保持不变的3D人体模型。该方法在规范的T型姿势空间中融合时间上的证据,生成的模型具备逼真的面部特征、精细的衣物褶皱以及高分辨率纹理,在用户偏好、身份保持和感知细节方面优于最先进方法超过89%(用户研究结果)。
We present a novel method for high detail-preserving human avatar creation from monocular video. A parameterized body model is refined and optimized to maximally resemble subjects from a video showing them from all sides. Our avatars feature a natural face, hairstyle, clothes with garment wrinkles, and high-resolution texture. Our paper contributes facial landmark and shading-based human body shape refinement, a semantic texture prior, and a novel texture stitching strategy, resulting in the most sophisticated-looking human avatars obtained from a single video to date. Numerous results show the robustness and versatility of our method. A user study illustrates its superiority over the state-of-the-art in terms of identity preservation, level of detail, realism, and overall user preference.
研究动机与目标
- 为解决从单张单目视频创建高保真、个性化的3D人体模型的挑战,该挑战因几何和外观线索有限而难以实现。
- 通过整合面部细节和精细的表面纹理(这些在现有单目重建方法中常被忽略),提升身份保持和感知真实感。
- 通过引入基于语义的纹理拼接策略和外观先验,克服多视角纹理融合中的纹理溢出和模糊问题。
- 通过将逐帧的3D证据(关键点、法向量)融合到规范姿态空间,实现对动态、可动人体的鲁棒重建。
提出的方法
- 该方法使用SMPL模型追踪人体姿态,并将逐帧的面部关键点投影射线变换到规范的T型姿势空间,以实现时间上的融合与形状优化。
- 在每一帧应用从明暗恢复形状方法以恢复部分3D法向场,随后在规范空间中融合,以增强如褶皱等表面细节。
- 提出一种基于二值优化的新型纹理拼接框架,通过最小化图割能量函数,高效地将来自多视角的RGB值分配给纹理像素。
- 在纹理更新能量函数中集成语义外观先验,基于基于部位的外观分布惩罚不合理的颜色分配,以减少纹理溢出。
- 最终的3D重建通过SMPL人体模型进行正则化,同时保留高分辨率的几何结构和纹理,包括面部特征和衣物细节。
- 所有组件在统一框架中联合优化,结合来自单个视频序列的几何、明暗和外观线索。
实验结果
研究问题
- RQ1能否有效融合单目视频中提取的面部关键点检测结果,以提升3D人脸重建质量与身份保持?
- RQ2如何聚合来自多个运动视角的从明暗恢复形状线索,以增强如褶皱等精细表面细节,而无需依赖深度传感器?
- RQ3能否设计一种可扩展且高效的纹理拼接方法,避免在合并运动中可动主体的局部纹理时产生模糊和颜色溢出?
- RQ4在单目3D人体模型重建中,引入语义外观先验在多大程度上提升了纹理的一致性和真实感?
- RQ5所提出的方法在感知质量方面是否显著优于最先进方法,如用户偏好和对真实感与身份保持的详细评估所示?
主要发现
- 本方法在[3]的最先进方法基础上,用户偏好率达到89.64%,在真实世界评估中表现出显著的感知优越性。
- 用户在95.72%的时间内认为我们的模型更具细节,证实了该方法在保留精细几何结构和表面纹理方面的成功。
- 在带纹理网格对比中,身份保持率提升至83.12%,在无纹理对比中为65.70%,专家用户在身份识别中准确率显著更高(达90.48%)。
- 语义纹理先验有效减少了颜色溢出,如图9所示,皮肤区域向衣物区域的纹理泛滥现象被显著最小化。
- 从明暗恢复形状的整合增强了表面细节,图8中的视觉结果清晰显示了面部和衣物褶皱真实感的显著提升。
- 用户研究证实,我们的模型在92.27%的时间内被认为更具真实感,突显了该方法在实现感知上令人信服结果方面的成功。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。