[论文解读] IPDreamer: Appearance-Controllable 3D Object Generation with Complex Image Prompts
IPDreamer 提出了一种新颖的文本到3D生成框架,通过在优化过程中引入图像提示,实现了外观可控的3D物体合成。该方法采用图像提示得分蒸馏(IPSD)技术,结合图像提示嵌入和法向图,实现了高保真度、具备风格迁移能力的3D生成,其在可控性和真实感方面优于SOTA方法,即使在文本与图像提示冲突的情况下亦表现优异。
Recent advances in 3D generation have been remarkable, with methods such as DreamFusion leveraging large-scale text-to-image diffusion-based models to guide 3D object generation. These methods enable the synthesis of detailed and photorealistic textured objects. However, the appearance of 3D objects produced by such text-to-3D models is often unpredictable, and it is hard for single-image-to-3D methods to deal with images lacking a clear subject, complicating the generation of appearance-controllable 3D objects from complex images. To address these challenges, we present IPDreamer, a novel method that captures intricate appearance features from complex $ extbf{I}$mage $ extbf{P}$rompts and aligns the synthesized 3D object with these extracted features, enabling high-fidelity, appearance-controllable 3D object generation. Our experiments demonstrate that IPDreamer consistently generates high-quality 3D objects that align with both the textual and complex image prompts, highlighting its promising capability in appearance-controlled, complex 3D object generation. Our code is available at https://github.com/zengbohan0217/IPDreamer.
研究动机与目标
- 为解决现有文本到3D生成方法中缺乏外观可控性的问题,即由于随机LoRA微调导致生成的3D物体纹理随机且不可控。
- 在现有得分蒸馏方法(如SDS和VSD)的基础上进行改进,通过引入图像提示而非仅依赖文本描述,提供更丰富的外观引导。
- 即使参考图像的结构与目标3D几何结构显著不同,也能实现从参考图像到3D物体的风格迁移。
- 开发一个统一框架,同时优化3D网格几何与纹理,利用图像提示嵌入和法向图以提升视觉保真度。
提出的方法
- IPDreamer 使用 Zero-1-to-3 进行多视角生成,为基于NeRF的3D表示提供强3D先验。
- 采用 IP-Adapter 从生成的参考图像及其对应的法向图中提取图像提示嵌入。
- 提出图像提示得分蒸馏(IPSD)作为新的优化目标,利用图像提示嵌入同时指导纹理与几何优化。
- 通过最小化包含几何感知正则化项 δ_geo 和基于图像提示特征的感知损失的联合损失,优化3D网格。
- 框架使用参数化得分模型将文本提示视为随机变量,相比标准SDS,提升了多样性并减少了过度平滑现象。
- 在单图像到3D生成中,IPDreamer 将 IPSD 与 Zero-123 结合,以保持身份与细节,同时实现风格迁移。
实验结果
研究问题
- RQ1在3D物体生成中,图像提示是否能比仅使用文本提示提供更有效且可控的外观引导?
- RQ2引入图像提示嵌入和法向图在多大程度上提升了生成3D物体的保真度与风格对齐?
- RQ3IPDreamer 在图像与3D网格结构差异显著的情况下,能多大程度上将多样化参考图像的视觉风格迁移到3D网格上?
- RQ4所提出的 IPSD 损失是否在生成高质量、多样化且可控的3D物体方面优于现有得分蒸馏方法(如 SDS 和 VSD)?
- RQ5IPDreamer 是否能在单图像到3D生成中有效平衡身份保持与风格迁移?
主要发现
- IPDreamer 成功地将图像提示的视觉风格迁移到3D物体上,即使参考图像与3D网格具有不同的结构布局。
- 在文本与图像提示冲突的情况下(例如‘铁’与‘皮革’外观),图像提示在最终3D输出中占据主导地位,展现出强大的外观控制能力。
- 消融研究证实,几何优化损失 ℒ_IPSD-Geo 有效捕捉了来自图像提示的高频细节,如细化的法向图所示。
- 引入 δ_geo 显著提升了纹理质量和身份保持能力,视觉对比显示其结果优于未使用该正则化项的方法。
- IPDreamer 在定性和定量评估中均优于 SOTA 方法(如 DreamFusion、Magic3D、Fantasia3D 和 ProlificDreamer),尤其在外观可控性和风格对齐方面表现更优。
- 该框架实现了从文本与图像提示联合输入以及单图像到3D生成的高质量3D生成,相比基线方法在细节与一致性方面均有显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。