[论文解读] ROOTS: Object-Centric Representation and Rendering of 3D Scenes
ROOTS 提出了一种无监督、端到端可微的生成模型,通过推断单个物体结构并将其组合,从部分观测中学习以物体为中心的3D场景表征。该模型通过使用 GQN 作为内部模块的嵌套自编码器架构,在3D场景生成、逐物体操作以及对未见物体数量的泛化方面实现了最先进性能。
A crucial ability of human intelligence is to build up models of individual 3D objects from partial scene observations. Recent works achieve object-centric generation but without the ability to infer the representation, or achieve 3D scene representation learning but without object-centric compositionality. Therefore, learning to represent and render 3D scenes with object-centric compositionality remains elusive. In this paper, we propose a probabilistic generative model for learning to build modular and compositional 3D object models from partial observations of a multi-object scene. The proposed model can (i) infer the 3D object representations by learning to search and group object areas and also (ii) render from an arbitrary viewpoint not only individual objects but also the full scene by compositing the objects. The entire learning process is unsupervised and end-to-end. In experiments, in addition to generation quality, we also demonstrate that the learned representation permits object-wise manipulation and novel scene generation, and generalizes to various settings. Results can be found on our project website: https://sites.google.com/view/roots3d
研究动机与目标
- 为填补无监督3D场景表征学习中的空白,通过从部分观测中实现以物体为中心的分解。
- 开发一种模型,推断3D物体表征并将其组合以实现从任意视角的渲染。
- 实现无需物体身份或布局监督的模块化、组合式3D表征的端到端无监督学习。
- 通过解耦的物体级表征,支持下游任务如物体操作和新场景生成。
- 泛化到训练时未见过的更多物体的场景,展示系统性泛化能力。
提出的方法
- ROOTS 采用分层生成模型,首先使用可微注意力机制从部分场景观测中识别并分组物体区域。
- 采用嵌套自编码器架构,其中内部自编码器为预训练的 GQN 模型,实现在物体级别的3D感知表征学习。
- 通过变分推断学习物体级3D表征,潜在变量同时编码每个物体的外观和3D几何信息。
- 通过基于推断的3D位置和姿态组合单个物体渲染结果实现场景渲染,从而实现从任意视角的新视角合成。
- 使用图网络对物体关系进行分类,并使用共享分类头支持下游任务如物体检索和成对分类。
- 训练完全无监督,采用负对数似然(NLL)损失和KL退火调度以稳定训练。
实验结果
研究问题
- RQ1模型能否在无监督条件下,从未完全观测的3D场景中推断出模块化、以物体为中心的3D表征?
- RQ2推断出的物体级表征能否支持对单个物体和完整场景的新视角合成的准确且可泛化的性能?
- RQ3该模型是否支持解耦的物体级操作,并能泛化到训练中未见的更多物体的场景?
- RQ4与场景级表征相比,以物体为中心的3D表征在结构准确性和下游任务性能方面表现如何?
- RQ5该模型能否泛化到训练分布之外的多样化场景配置和物体排列?
主要发现
- ROOTS 在模拟3D场景上实现了最先进生成质量,其负对数似然(NLL)低于 CGQN 和 IODINE 基线模型。
- 该模型成功学习了解耦的3D物体表征,支持对物体的逐个操作和最多10个物体的新场景生成,超过训练时的3–5个物体范围。
- 在 Retrieve Object 和 Find Pair 下游任务中,ROOTS 在 Multi-Shepard-Metzler 数据集上分别以85.6%和74.3%的准确率超越 CGQN 和 IODINE。
- 该模型在未见的物体排列和物体数量上表现出良好泛化能力,展示了超越插值的系统性泛化能力。
- 使用 GQN 作为内部自编码器模块,使架构更简单、更高效,同时保持高性能。
- 物体级表征支持准确的场景布局推理,这在成对关系分类任务中的高性能中得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。