[论文解读] HeadSculpt: Crafting 3D Head Avatars with Text
HeadSculpt 提出了一种新颖的从文本提示生成和编辑高保真3D人脸形象的粗到精流水线,通过基于关键点的ControlNet和学习得到的背面文本嵌入,实现3D感知的扩散模型,确保几何一致性。该方法进一步通过一种新颖的身份感知得分蒸馏(IESD)策略,实现保持身份的细粒度编辑,在保真度、编辑准确性和训练稳定性方面优于先前方法,适用于多种风格和编辑类型。
Recently, text-guided 3D generative methods have made remarkable advancements in producing high-quality textures and geometry, capitalizing on the proliferation of large vision-language and image diffusion models. However, existing methods still struggle to create high-fidelity 3D head avatars in two aspects: (1) They rely mostly on a pre-trained text-to-image diffusion model whilst missing the necessary 3D awareness and head priors. This makes them prone to inconsistency and geometric distortions in the generated avatars. (2) They fall short in fine-grained editing. This is primarily due to the inherited limitations from the pre-trained 2D image diffusion models, which become more pronounced when it comes to 3D head avatars. In this work, we address these challenges by introducing a versatile coarse-to-fine pipeline dubbed HeadSculpt for crafting (i.e., generating and editing) 3D head avatars from textual prompts. Specifically, we first equip the diffusion model with 3D awareness by leveraging landmark-based control and a learned textual embedding representing the back view appearance of heads, enabling 3D-consistent head avatar generations. We further propose a novel identity-aware editing score distillation strategy to optimize a textured mesh with a high-resolution differentiable rendering technique. This enables identity preservation while following the editing instruction. We showcase HeadSculpt's superior fidelity and editing capabilities through comprehensive experiments and comparisons with existing methods.
研究动机与目标
- 解决使用预训练2D扩散模型进行文本到3D人脸生成时缺乏3D感知和几何一致性的问题。
- 克服现有文本到3D方法中因提示偏置和不一致的梯度反向传播导致的身份丢失和编辑控制差的问题。
- 开发一种稳定、高保真的3D人脸形象生成与编辑流水线,可泛化至多种身份和风格。
- 实现对外观变化具有显式控制的细粒度编辑,同时保持身份一致性。
提出的方法
- 将基于关键点的ControlNet与预训练的文本到图像扩散模型结合,利用FLAME参数化人脸模型注入3D感知,并强制实现视图一致的人脸几何结构。
- 利用文本反转技术学习一个专门的<back-view>标记,强调背面细节,减轻扩散先验中的前视偏置。
- 采用粗到精的生成流水线:首先通过先验驱动的得分蒸馏生成基于NeRF的3D人脸,然后通过带纹理的网格进行优化。
- 提出身份感知得分蒸馏(IESD),将来自原始图像的身份保持梯度与来自提示的编辑特定梯度相结合,指导网格优化。
- 使用高分辨率可微渲染优化带纹理的网格,实现精细细节和逼真纹理。
- 采用两阶段优化:先进行粗粒度NeRF生成,再通过IESD进行高保真度网格优化,实现精确的编辑控制。

实验结果
研究问题
- RQ1通过基于关键点的控制和视图特定的文本嵌入实现3D感知条件控制,能否改善几何一致性并减少文本到3D人脸生成中的“双面人”(Janus)问题?
- RQ2能否通过显式平衡身份和编辑目标的得分蒸馏策略,在3D人脸形象中实现身份保持的编辑?
- RQ3在多个随机种子和多样化提示下,该方法与现有基于SDS的文本到3D方法相比,在稳定性和保真度方面表现如何?
- RQ4该方法在不造成身份退化的情况下,对多样化风格(如皮克斯、黏土动画、雕塑)和复杂编辑(如衰老、面部变换)的泛化能力如何?
主要发现
- HeadSculpt 在所有360°视角下均实现了卓越的几何一致性和视觉保真度,消除了基线方法中常见的多面孔‘双面人’问题。
- 该方法展示了稳定的训练性能,在多个随机种子下均能生成高质量结果,无需超参数调优或模型挑选。
- 身份感知得分蒸馏(IESD)实现了精确的身份保持编辑,如衰老、面部变换和风格迁移,优于基于提示的编辑基线方法。
- 定性比较显示,与DreamFusion*、Latent-NeRF、3DFuse和Fantasia3D*等现有方法相比,HeadSculpt在复杂编辑场景中生成了更逼真的纹理和更精细的几何细节。
- 该方法能够从简单的文本提示中生成高保真度的风格化形象(如头骨、黏土动画、木雕),在不同身份和风格下均保持一致结果。
- 消融研究证实,基于关键点的控制和<back-view>标记对减少几何失真和提升视图一致性均至关重要。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。