Skip to main content
QUICK REVIEW

[论文解读] ZeroAvatar: Zero-shot 3D Avatar Generation from a Single Image

Zhenzhen Weng, Zeyu Wang|arXiv (Cornell University)|May 25, 2023
3D Shape Modeling and Analysis被引用 4
一句话总结

ZeroAvatar 通过整合参数化 SMPL 身体模型作为几何先验、基于深度的得分蒸馏以及 UV 引导的纹理正则化,实现了从单张图像进行高保真、零样本 3D 虚拟化身生成。该方法显著提升了现有方法在复杂人体姿态下的 3D 一致性与几何保真度,并支持文本和姿态控制的 3D 虚拟化身生成。

ABSTRACT

Recent advancements in text-to-image generation have enabled significant progress in zero-shot 3D shape generation. This is achieved by score distillation, a methodology that uses pre-trained text-to-image diffusion models to optimize the parameters of a 3D neural presentation, e.g. Neural Radiance Field (NeRF). While showing promising results, existing methods are often not able to preserve the geometry of complex shapes, such as human bodies. To address this challenge, we present ZeroAvatar, a method that introduces the explicit 3D human body prior to the optimization process. Specifically, we first estimate and refine the parameters of a parametric human body from a single image. Then during optimization, we use the posed parametric body as additional geometry constraint to regularize the diffusion model as well as the underlying density field. Lastly, we propose a UV-guided texture regularization term to further guide the completion of texture on invisible body parts. We show that ZeroAvatar significantly enhances the robustness and 3D consistency of optimization-based image-to-3D avatar generation, outperforming existing zero-shot image-to-3D methods.

研究动机与目标

  • 解决现有零样本 3D 生成方法在重建复杂人体时存在的 3D 一致性差和几何保真度低的问题。
  • 克服基于扩散模型的优化方法缺乏显式人体结构感知能力的局限性。
  • 通过引入显式的 3D 人体先验和纹理正则化,提升对不可见身体部位的重建保真度。
  • 利用预训练的文本到图像扩散模型作为先验,实现零样本的文本和姿态控制 3D 虚拟化身生成。
  • 通过使用基于粗略 SMPL 的形状和深度监督初始化 NeRF,提升优化的鲁棒性和收敛速度。

提出的方法

  • 从单张图像估计并优化参数化 SMPL 身体模型,以获得人体形状和姿态的 3D 先验。
  • 在得分蒸馏过程中,将带姿态的 SMPL 模型的深度图作为附加条件信号,输入至文本到图像扩散模型(如 Stable Diffusion)。
  • 使用基于 SMPL 的粗略几何结构初始化 NeRF 密度场,以提升优化的稳定性和收敛速度。
  • 引入基于 UV 的纹理正则化项,在 NeRF 优化过程中引导对遮挡或不可见身体部位的外观补全。
  • 应用带深度条件的潜在扩散模型的得分蒸馏损失,使生成的 NeRF 视图在 SMPL 先验的几何约束下与参考图像对齐。
  • 利用优化后的 NeRF 作为支持下游文本或姿态编辑控制的 3D 虚拟化身,基于预训练的文本到图像模型。

实验结果

研究问题

  • RQ1显式的 3D 人体先验是否能提升从单张图像进行零样本 3D 虚拟化身生成的 3D 一致性和几何保真度?
  • RQ2将参数化人体模型提供的深度监督引入后,对基于扩散模型的 NeRF 优化的稳定性和收敛性有何影响?
  • RQ3基于 UV 的纹理正则化在单张图像 3D 重建中,对不可见身体部位的外观一致性提升程度如何?
  • RQ4所提方法是否能在保持几何与外观保真度的前提下,实现零样本的文本或姿态控制 3D 虚拟化身生成?
  • RQ5与基线零样本方法相比,该方法在复杂非标准人体姿态下的表现如何?

主要发现

  • ZeroAvatar 在复杂姿态下的上下文损失(3.3,对应困难姿态)和 CLIP 图像相似度(87.0)方面达到当前最优性能,优于 Make-it-3D 和 Stable-DreamFusion 等基线方法。
  • 该方法在所有姿态复杂度等级(简单、中等、困难)中均表现出一致的改进,困难姿态下的上下文损失为 3.0,优于次优方法的 3.3。
  • ZeroAvatar 的收敛速度显著快于基线方法——在第 5 个训练周期即实现一致的 3D 形状,而 Make-it-3D 至少需要 10 个周期。
  • ZeroAvatar 的优化过程更具鲁棒性,避免了基线方法(如 Make-it-3D)中常见的发散问题,后者偶尔无法恢复合理的几何结构。
  • 即使在 SMPL 无法完全表达身体比例的失败案例中,ZeroAvatar 生成的新视角渲染结果也比基线方法更一致。
  • LPIPS 分数略高于某些基线方法(如困难姿态下为 0.38),但这是由于基线方法对参考视角过拟合并扭曲了几何结构,并非 ZeroAvatar 的外观质量存在问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。