Skip to main content
QUICK REVIEW

[论文解读] NeRF-Art: Text-Driven Neural Radiance Fields Stylization

Can Wang, Ruixiang Jiang|arXiv (Cornell University)|Dec 15, 2022
Computer Graphics and Visualization Techniques被引用 7
一句话总结

NeRF-Art 提出了一种文本驱动的神经辐射场风格化方法,仅通过文本提示即可同时操控预训练 NeRF 的外观与几何结构。通过结合全局-局部对比损失、方向性 CLIP 引导以及权重正则化,该方法在无需网格监督的情况下实现了稳定且高质量的风格化,有效抑制了伪影,并实现了跨视角的一致性风格迁移。

ABSTRACT

As a powerful representation of 3D scenes, the neural radiance field (NeRF) enables high-quality novel view synthesis from multi-view images. Stylizing NeRF, however, remains challenging, especially on simulating a text-guided style with both the appearance and the geometry altered simultaneously. In this paper, we present NeRF-Art, a text-guided NeRF stylization approach that manipulates the style of a pre-trained NeRF model with a simple text prompt. Unlike previous approaches that either lack sufficient geometry deformations and texture details or require meshes to guide the stylization, our method can shift a 3D scene to the target style characterized by desired geometry and appearance variations without any mesh guidance. This is achieved by introducing a novel global-local contrastive learning strategy, combined with the directional constraint to simultaneously control both the trajectory and the strength of the target style. Moreover, we adopt a weight regularization method to effectively suppress cloudy artifacts and geometry noises which arise easily when the density field is transformed during geometry stylization. Through extensive experiments on various styles, we demonstrate that our method is effective and robust regarding both single-view stylization quality and cross-view consistency. The code and more results can be found in our project page: https://cassiepython.github.io/nerfart/.

研究动机与目标

  • 实现无需网格监督的文本引导 NeRF 风格化,同时修改几何与外观。
  • 解决现有 NeRF 风格化方法中风格化强度不一致及跨视角一致性差的挑战。
  • 抑制 NeRF 风格化过程中因几何形变引入的云状伪影与几何噪声。
  • 仅使用自然语言提示实现均匀且语义有意义的风格迁移。
  • 在多种风格和 NeRF 类似架构(包括 VolSDF 和 NeuS)上展示方法的鲁棒性。

提出的方法

  • 提出一种全局-局部对比学习策略,确保局部图像块与整个场景之间风格强度的一致性。
  • 采用方向性 CLIP 引导,使风格化轨迹在 CLIP 嵌入空间中与文本提示的语义方向对齐。
  • 应用权重正则化损失,集中密度场以减少几何形变过程中的云状伪影。
  • 采用两阶段优化流程:首先通过对比损失将风格化 NeRF 的特征与文本提示对齐,然后通过方向性约束进行精炼。
  • 利用 CLIP 的视觉-语言嵌入,引导外观与形状的联合变换,无需参考图像或显式的几何监督。
  • 通过在 VolSDF 和 NeuS 等模型上应用相同的损失与优化框架,使风格化过程适配不同 NeRF 架构。

实验结果

研究问题

  • RQ1仅靠文本提示能否引导一致且高质量的 NeRF 风格化,同时改变外观与几何?
  • RQ2如何结合全局与局部对比学习,实现在 3D 场景中均匀的风格迁移?
  • RQ3方向性 CLIP 引导在控制风格迁移轨迹与强度方面发挥什么作用?
  • RQ4权重正则化能否有效抑制 NeRF 风格化过程中产生的几何伪影与密度噪声?
  • RQ5该方法在不同 NeRF 架构与多样艺术风格上的泛化能力如何?

主要发现

  • 所提出的全局-局部对比损失显著提升了风格化的均匀性,相比单独使用全局或局部损失,有效减少了不同区域的过度或不足风格化现象。
  • 将方向性 CLIP 引导与对比学习结合,可实现对风格化轨迹的精确控制,从而获得更具语义一致性的风格化结果。
  • 权重正则化能有效抑制云状伪影与几何噪声,尤其在形变剧烈区域表现显著,如定性对比所示。
  • 该方法在复杂场景(如人脸与抽象环境)中,也能在多个视角下实现一致且视觉上令人愉悦的风格化。
  • NeRF-Art 在不同 NeRF 类似模型(包括 VolSDF 和 NeuS)上表现出良好泛化能力,证明了其在架构间的可迁移性。
  • 当提示语义模糊或无意义时(如 '数字绘画' 或 '口部蝙蝠'),方法可能出现意外或荒谬的结果,存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。