[论文解读] Learning Object-Compositional Neural Radiance Field for Editable Scene Rendering
本文提出了一种基于物体组成的神经辐射场,仅使用带姿态的图像和粗略的2D实例分割掩码,即可实现在真实世界场景中的高保真新视角合成与可编辑场景渲染。该方法引入了一种双路架构,其中场景分支负责背景渲染,物体分支则基于可学习的激活码进行条件控制,结合场景引导训练与3D保护掩码,以解决遮挡模糊性问题并生成清晰的物体边界,在静态视角合成与动态编辑任务中均达到最先进性能。
Implicit neural rendering techniques have shown promising results for novel view synthesis. However, existing methods usually encode the entire scene as a whole, which is generally not aware of the object identity and limits the ability to the high-level editing tasks such as moving or adding furniture. In this paper, we present a novel neural scene rendering system, which learns an object-compositional neural radiance field and produces realistic rendering with editing capability for a clustered and real-world scene. Specifically, we design a novel two-pathway architecture, in which the scene branch encodes the scene geometry and appearance, and the object branch encodes each standalone object conditioned on learnable object activation codes. To survive the training in heavily cluttered scenes, we propose a scene-guided training strategy to solve the 3D space ambiguity in the occluded regions and learn sharp boundaries for each object. Extensive experiments demonstrate that our system not only achieves competitive performance for static scene novel-view synthesis, but also produces realistic rendering for object-level editing.
研究动机与目标
- 在现有神经渲染方法无法支持物体级操作的真实世界杂乱环境中,实现高质量且可编辑的场景渲染。
- 解决训练过程中因部分观测导致遮挡区域在3D空间中存在模糊性的问题,避免物体边界难以学习。
- 设计一种将场景分解为物体组成组件的神经渲染系统,同时保持逼真的外观与几何结构。
- 在无需精确3D标注或每对象训练数据的前提下,实现清晰、无渗色的物体渲染。
提出的方法
- 一种双路神经辐射场架构:场景分支编码全局几何与外观,物体分支则基于可学习的物体激活码渲染单个物体。
- 采用带偏差的光线采样与在线深度预测的场景引导训练,以解决遮挡区域中的3D模糊性,防止网络将被遮挡的物体部分误认为为空间。
- 引入3D保护掩码机制,通过在物体体素周围施加空间边界约束,确保物体完整性,从而提升渲染保真度。
- 联合渲染经变换的物体(如移动、旋转、复制)来自物体分支,以及来自场景分支的背景,以实现动态场景编辑。
- 利用2D实例掩码进行监督,多视角一致性有助于在训练过程中去噪并优化物体边界。
- 物体分支整合3D体素特征,以增强局部表征能力,提升组合渲染质量。

实验结果
研究问题
- RQ1能否仅使用带姿态的图像和粗略的2D实例掩码,训练出一种神经辐射场,以实现在真实世界杂乱场景中的可编辑场景渲染?
- RQ2在训练过程中,如何解决遮挡区域的3D空间模糊性,以防止物体边界渗色并确保渲染清晰?
- RQ3何种架构设计可实现在统一框架下,同时支持高保真静态视角合成与动态物体级编辑?
- RQ4在部分遮挡条件下,场景引导与3D保护掩码在多大程度上提升了物体渲染质量?
- RQ5模型能否在无需精确3D标注的前提下,从噪声较大的2D实例掩码中学习到准确且平滑的物体边界?
主要发现
- 与最先进方法相比,该方法在真实世界ScanNet场景上的标准新视角合成指标(PSNR、SSIM、LPIPS)中表现具有竞争力或更优。
- 在ScanNet 0038场景中,结合场景引导与3D保护掩码后,被遮挡物体的PSNR达到34.435,显著优于基线配置。
- 当ε = 0.05时,3D保护掩码取得最佳渲染质量,且在不同ε值下结果保持稳定,表明对超参数选择不敏感。
- 物体体素特征(f_obj)提升了渲染质量,证明可学习的3D特征能增强模型对物体特异性细节的表征能力。
- 尽管仅使用粗略的2D实例掩码,模型仍能生成平滑、高保真的2D物体分割结果与清晰的物体渲染,表明其能有效从2D监督中推断3D结构。
- 可视化结果证实,即使输入掩码存在噪声或抖动,模型仍能成功学习准确的物体边界并保留细节(如椅子扶手),表现优异。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。