Skip to main content
QUICK REVIEW

[论文解读] X-Mesh: Towards Fast and Accurate Text-driven 3D Stylization via Dynamic Textual Guidance

Yiwei Ma, Xiaioqing Zhang|arXiv (Cornell University)|Mar 28, 2023
3D Shape Modeling and Analysis被引用 4
一句话总结

X-Mesh 提出了一种文本驱动的3D风格化框架,通过文本引导的动态注意力模块(TDAM)将动态文本语义注入顶点特征提取过程,实现了更快的收敛速度和更准确、语义对齐的风格化效果。在新的 MIT-30 基准测试中,该方法以 29.26 的 MES 得分和 88.53 的 ITS 取得最先进性能,在质量和速度方面均优于先前方法。

ABSTRACT

Text-driven 3D stylization is a complex and crucial task in the fields of computer vision (CV) and computer graphics (CG), aimed at transforming a bare mesh to fit a target text. Prior methods adopt text-independent multilayer perceptrons (MLPs) to predict the attributes of the target mesh with the supervision of CLIP loss. However, such text-independent architecture lacks textual guidance during predicting attributes, thus leading to unsatisfactory stylization and slow convergence. To address these limitations, we present X-Mesh, an innovative text-driven 3D stylization framework that incorporates a novel Text-guided Dynamic Attention Module (TDAM). The TDAM dynamically integrates the guidance of the target text by utilizing text-relevant spatial and channel-wise attentions during vertex feature extraction, resulting in more accurate attribute prediction and faster convergence speed. Furthermore, existing works lack standard benchmarks and automated metrics for evaluation, often relying on subjective and non-reproducible user studies to assess the quality of stylized 3D assets. To overcome this limitation, we introduce a new standard text-mesh benchmark, namely MIT-30, and two automated metrics, which will enable future research to achieve fair and objective comparisons. Our extensive qualitative and quantitative experiments demonstrate that X-Mesh outperforms previous state-of-the-art methods.

研究动机与目标

  • 为解决现有文本驱动3D风格化方法在顶点属性预测过程中缺乏文本语义引导的问题,该问题导致结果不一致且收敛缓慢。
  • 通过引入标准化基准和自动化度量,克服现有评估中依赖主观、不可复现的用户研究的局限性。
  • 开发一种框架,实现高质量风格化并显著缩短训练时间,从而支持实际的实时或近实时3D内容创作。
  • 通过新基准和两种自动化度量,建立公平且可复现的评估协议,以推动未来在文本驱动3D风格化领域的研究。

提出的方法

  • 提出一种文本引导的动态注意力模块(TDAM),根据文本特征动态生成空间和通道注意力权重,以指导顶点特征提取。
  • 采用基于 CLIP 的文本编码生成查询向量,以条件化注意力模块,确保预测的顶点属性与输入文本在语义上保持一致。
  • 采用多阶段训练流程,利用注意力引导的特征预测顶点属性(如颜色、位移等),并通过渲染图像与文本提示之间的 CLIP 损失进行监督。
  • 构建 MIT-30 基准,包含 30 种网格类别,每类配以 5 个多样化的文本提示,以实现方法间的标准化评估。
  • 提出两种自动化评估度量:多视角专家评分(MES)用于衡量风格化质量,目标达成迭代数(ITS)用于衡量收敛速度。
  • 采用固定相机角度渲染每个风格化网格的 24 个视角,以实现一致评估,支持模型间的客观比较。

实验结果

研究问题

  • RQ1在顶点属性预测过程中引入动态文本引导,是否能显著提升文本驱动3D风格化在语义一致性和视觉质量方面的表现?
  • RQ2与传统无文本依赖的MLP相比,集成文本感知注意力机制对收敛速度有何影响?
  • RQ3标准化基准和自动化度量是否能够取代主观用户研究,以确保3D风格化质量评估的可复现性和公平性?
  • RQ4所提框架在处理复杂或模糊的文本提示时,是否能有效避免崩溃或丢失语义细节?
  • RQ5与最先进基线方法相比,该方法在风格化质量与训练效率方面是否均表现出更优性能?

主要发现

  • X-Mesh 在 MIT-30 基准上的多视角专家评分(MES)达到 29.26,相比之前最先进方法 Text2Mesh(28.85)绝对提升 0.41。
  • X-Mesh 的目标达成迭代数(ITS)为 88.53,显著低于 Text2Mesh(173.27)和 TANGO(795.47),表明收敛速度更快。
  • 借助 TDAM,X-Mesh 在 200 次迭代内(约 3 分钟)即可达到稳定结果,而无 TDAM 的基线模型需超过 500 次迭代(超过 8 分钟)。
  • X-Mesh 搭载 TDAM 的损失曲线下降速度明显快于基线,证实了训练效率提升与更快收敛。
  • 在复杂提示场景下,X-Mesh 搭载 TDAM 能够保持几何完整性并捕捉细微特征(如“黑色领结”、“彩色手套”),而基线模型则出现崩溃或忽略此类属性。
  • TDAM 模块使模型在多样化和复杂提示下具备更强泛化能力,展现出在属性预测中的鲁棒性与语义感知能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。