[论文解读] OBJECT 3DIT: Language-guided 3D-aware Image Editing
本文提出 OBJECT 3DIT,一种基于语言引导的 3D 感知图像编辑框架,可实现对图像中物体的精确、物理上合理的编辑——包括平移、旋转、插入和移除——同时保持场景的几何结构、光照和阴影。该模型在包含 400,000 个样本的合成数据集(OBJect)上进行训练,该数据集由程序化生成的 3D 场景构成,3DIT 在真实世界图像上表现出色,无论在定量指标还是人类评估中均优于基线模型,各项任务的偏好率均超过 70%。
Existing image editing tools, while powerful, typically disregard the underlying 3D geometry from which the image is projected. As a result, edits made using these tools may become detached from the geometry and lighting conditions that are at the foundation of the image formation process. In this work, we formulate the newt ask of language-guided 3D-aware editing, where objects in an image should be edited according to a language instruction in context of the underlying 3D scene. To promote progress towards this goal, we release OBJECT: a dataset consisting of 400K editing examples created from procedurally generated 3D scenes. Each example consists of an input image, editing instruction in language, and the edited image. We also introduce 3DIT : single and multi-task models for four editing tasks. Our models show impressive abilities to understand the 3D composition of entire scenes, factoring in surrounding objects, surfaces, lighting conditions, shadows, and physically-plausible object configurations. Surprisingly, training on only synthetic scenes from OBJECT, editing capabilities of 3DIT generalize to real-world images.
研究动机与目标
- 解决现有图像编辑工具忽略底层 3D 场景几何结构和光照的问题,从而导致物理上不合理的编辑结果。
- 提出一项新任务——语言引导的 3D 感知图像编辑,使编辑操作尊重 3D 场景上下文,包括物体位置、表面接触、阴影和光照。
- 构建一个大规模、程序化生成的数据集(OBJect),包含 400,000 个编辑样本,以支持 3D 感知编辑模型的训练与评估。
- 设计并训练 3DIT,一个基于扩散模型的模型,通过在 OBJect 数据集上进行微调,实现语言条件控制下的四种物体编辑任务。
- 证明仅在合成 3D 场景上训练的模型能够有效泛化至真实世界图像,实现实用且场景一致的编辑。
提出的方法
- 作者构建了 OBJect 数据集,该数据集包含 400,000 对图像编辑样本,源自使用 Objaverse 和 Blender 生成的程序化 3D 场景,光照、表面和物体位置均受控。
- 每个样本包含一张源图像、一条描述四种编辑操作之一(平移、旋转、插入、移除)的自然语言指令,以及一张真实编辑后的图像作为监督信号。
- 3DIT 初始从 Zero-1-to-3 扩散模型进行初始化,并通过三阶段学习课程在 OBJect 数据集上进行微调:大规模预训练、3D 感知预训练和任务特定微调。
- 该模型支持单任务与多任务两种变体,通过统一架构联合预测所有四种编辑操作。
- 模型通过显式保持物体尺度、视角、表面接触和阴影动态,来建模 3D 场景的一致性。
- 评估采用定量指标(忠实度、真实感)和人类偏好研究,以衡量几何与光照一致性。

实验结果
研究问题
- RQ1仅在合成 3D 场景上训练的模型是否能在真实世界图像上实现逼真且 3D 一致的图像编辑?
- RQ2语言条件扩散模型在物体编辑过程中,能否有效保持 3D 场景属性(如阴影、物体尺度和遮挡)?
- RQ33DIT 在物体平移、旋转、插入和移除过程中,与现有基线相比,在几何与光照一致性方面表现如何?
- RQ4单一多任务 3DIT 模型是否能有效处理所有四种编辑任务而不产生显著性能下降?
- RQ5与基线模型相比,人类标注者如何评价 3DIT 输出在几何与光照保真度方面的表现?
主要发现
- 在平移任务中,3DIT 在几何一致性方面获得 73.3% 的人类偏好得分,在光照一致性方面获得 80.0%,显著优于基线模型。
- 在移除任务中,3DIT 在几何一致性方面获得 86.6% 的偏好得分,在光照一致性方面也达到 86.6%,表明其在遮挡和阴影处理方面表现强劲。
- 在旋转任务中,3DIT 在几何一致性方面获得 80.0% 的偏好得分,在光照一致性方面获得 73.3%,表明其能准确实现旋转与阴影渲染。
- 3DIT 的多任务变体在所有四项任务中均表现良好,未出现显著性能下降,表明其在不同编辑类型间实现了有效的参数共享。
- 尽管仅在合成数据上进行训练,3DIT 仍能有效泛化至真实世界图像,生成具有连贯阴影和场景结构的逼真图像。
- 当物体被移除或重新定位时,3DIT 能成功修复先前被遮挡的区域,保持场景连贯性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。