Skip to main content
QUICK REVIEW

[论文解读] Instruct-NeRF2NeRF: Editing 3D Scenes with Instructions

Ayaan Haque, Matthew Tancik|arXiv (Cornell University)|Mar 22, 2023
Advanced Vision and Imaging被引用 4
一句话总结

Instruct-NeRF2NeRF 通过使用 InstructPix2Pix 迭代优化输入图像并重新训练 NeRF,实现通过自然语言指令对 3D 场景进行编辑,从而在不同视角下实现一致且高质量的编辑效果。该方法支持多种编辑类型,如物体替换和风格迁移,同时保持 3D 一致性。

ABSTRACT

We propose a method for editing NeRF scenes with text-instructions. Given a NeRF of a scene and the collection of images used to reconstruct it, our method uses an image-conditioned diffusion model (InstructPix2Pix) to iteratively edit the input images while optimizing the underlying scene, resulting in an optimized 3D scene that respects the edit instruction. We demonstrate that our proposed method is able to edit large-scale, real-world scenes, and is able to accomplish more realistic, targeted edits than prior work.

研究动机与目标

  • 实现无需专业 3D 编辑工具或专业知识的直观、基于文本的预捕获 NeRF 场景编辑。
  • 通过将迭代图像编辑与 NeRF 重训练相结合,解决基于 2D 扩散模型编辑中的 3D 不一致性问题。
  • 通过利用预训练的视觉-语言模型和扩散模型实现自然语言控制,提升 3D 编辑的可访问性。
  • 证明基于指令的编辑可在真实世界的大规模场景中实现逼真、精准且一致的 3D 场景修改。

提出的方法

  • 在每个训练视角上,使用图像条件扩散模型 InstructPix2Pix 对从 NeRF 渲染的图像进行编辑。
  • 采用迭代数据集更新(Iterative DU)策略:编辑渲染图像,用原始训练集中的图像替换,并重新训练 NeRF。
  • 在当前 NeRF 渲染视图、通过 InstructPix2Pix 使用文本指令编辑图像、并用编辑后的图像更新 NeRF 之间交替进行。
  • 通过确保编辑在 NeRF 优化过程中传播至所有视角,保持 3D 一致性。
  • 采用训练循环,逐步利用编辑后的图像优化 NeRF,同时保持几何和外观的一致性。
  • 利用预训练的扩散模型提取形状和外观先验,避免对大规模 3D 训练数据的需求。

实验结果

研究问题

  • RQ1能否在不使用显式 3D 编辑工具的情况下,通过基于文本的指令对真实世界 NeRF 场景实现一致且具备 3D 意识的编辑?
  • RQ2与基于分数蒸馏采样(SDS)的端到端优化相比,使用扩散模型进行迭代图像编辑在 3D 一致性和编辑质量方面表现如何?
  • RQ3基于指令的编辑在处理复杂编辑(如物体替换、纹理变化和全局风格迁移)方面的能力有多大?
  • RQ4当底层扩散模型无法生成一致的 2D 编辑时,该方法的失败模式是什么?
  • RQ5与 NeRF-Art 或 CLIP 引导编辑等先前方法相比,该方法在多样化、大规模真实世界场景中的表现如何?

主要发现

  • 该方法成功在真实世界 NeRF 场景中实现了广泛的编辑操作,包括物体替换、纹理修改和全局风格迁移,且 3D 一致性表现优异。
  • 定量评估显示,与基线方法相比,文本指令与 3D 编辑之间的对齐程度更高,方向相似性度量表明在新视角下具有强一致性。
  • 迭代数据集更新(Iterative DU)方法优于朴素的 SDS 基优化方法,后者因缺乏图像条件而表现出不稳定和模糊的结果。
  • 与 StableDiffusion 相比,使用 InstructPix2Pix 显著提升了 3D 一致性,因为后者缺乏图像条件,导致输出模糊且不一致。
  • 该方法继承了 InstructPix2Pix 的局限性,例如在空旷或复杂区域中无法一致地添加或删除物体。
  • 失败案例包括 2D 编辑失败(例如 InstructPix2Pix 无法添加一顶帽子)以及不一致的 2D 编辑传播至 3D,表明该方法对 2D 模型可靠性的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。