[论文解读] Progressive3D: Progressively Local Editing for Text-to-3D Content Creation with Complex Semantic Prompts
Progressive3D 通过将生成过程分解为局部化、渐进式的编辑步骤,提出了一种通用框架,以在复杂语义提示下实现精确的文本到3D生成。它利用区域引导约束和重叠语义组件抑制(OSCS)来提升语义对齐,在多种3D表示形式下,对复杂提示实现了最先进性能,人类偏好度达83.2%,优于基线方法。
Recent text-to-3D generation methods achieve impressive 3D content creation capacity thanks to the advances in image diffusion models and optimizing strategies. However, current methods struggle to generate correct 3D content for a complex prompt in semantics, i.e., a prompt describing multiple interacted objects binding with different attributes. In this work, we propose a general framework named Progressive3D, which decomposes the entire generation into a series of locally progressive editing steps to create precise 3D content for complex prompts, and we constrain the content change to only occur in regions determined by user-defined region prompts in each editing step. Furthermore, we propose an overlapped semantic component suppression technique to encourage the optimization process to focus more on the semantic differences between prompts. Extensive experiments demonstrate that the proposed Progressive3D framework generates precise 3D content for prompts with complex semantics and is general for various text-to-3D methods driven by different 3D representations.
研究动机与目标
- 为解决在文本提示描述多个具有复杂、相互关联属性的对象时,生成准确3D内容的挑战。
- 克服现有文本到3D方法在复杂语义下存在的对象缺失、属性错配和质量下降等局限。
- 开发一种可泛化的框架,兼容多种3D神经表示形式和优化策略。
- 通过渐进式、局部化编辑,提升生成3D内容与复杂提示之间的语义一致性。
提出的方法
- 将复杂的文本到3D生成任务分解为一系列由用户定义的区域提示引导的局部编辑步骤。
- 应用一致性约束以保留编辑区域外的内容,以及初始化约束以促进从空空间生成几何结构。
- 引入重叠语义组件抑制(OSCS),以隔离并突出源提示与目标提示之间的语义差异。
- 采用基于潜在扩散的优化过程,仅聚焦于指定区域的编辑,同时最小化对其他区域的干扰。
- 利用CLIP嵌入计算语义差异,并通过注意力掩码引导优化过程。
- 支持多种3D表示形式,包括NeRF、SDF和DMTet,实现与现有文本到3D模型的广泛兼容性。
实验结果
研究问题
- RQ1渐进式、局部化编辑是否能提升复杂提示下文本到3D生成的语义对齐?
- RQ2重叠语义组件抑制(OSCS)在减少复杂提示中共享属性带来的干扰方面效果如何?
- RQ3所提出的框架是否能在不同3D神经表示和优化流程中实现泛化?
- RQ4渐进式编辑在保持结构和属性一致性方面,相较于直接微调,优势有多大?
- RQ5各个组件(一致性约束、初始化约束、OSCS)对整体性能的贡献如何?
主要发现
- 在CSP-100基准测试中,Progressive3D 的 B-VQA 得分为 0.474,mGPT-CoT 得分为 0.609,显著优于基线方法 DreamTime(分别为 0.227 和 0.522)。
- 在人类偏好研究中,83.2% 的用户更偏好 Progressive3D 生成的结果,表明其与复杂提示具有更强的感知对齐性。
- 消融实验表明,结合初始化约束与 OSCS 可获得最高性能,当所有组件均启用时,B-VQA 得分为 0.474。
- 随着抑制权重的增加,OSCS 能更专注于语义差异,减少对象缺失和属性错配。
- 通过定性和定量分析验证,该框架能有效缓解复杂提示下的对象缺失和属性错配问题。
- 该方法在多种3D表示形式(包括NeRF、SDF和DMTet)上均表现良好,展现出广泛的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。