[论文解读] Deep Generative Modeling for Scene Synthesis via Hybrid Representations
本文提出一种前馈式深度生成模型,用于结合3D物体排列与2D图像监督的混合表示,实现3D室内场景合成。通过训练一个稀疏连接的神经网络,将潜在向量映射到场景配置(编码物体位置、朝向、尺寸和数量),该方法在保持更高保真度与多样性的同时,实现了比顺序方法更快的推理速度与更优的一致性。
We present a deep generative scene modeling technique for indoor environments. Our goal is to train a generative model using a feed-forward neural network that maps a prior distribution (e.g., a normal distribution) to the distribution of primary objects in indoor scenes. We introduce a 3D object arrangement representation that models the locations and orientations of objects, based on their size and shape attributes. Moreover, our scene representation is applicable for 3D objects with different multiplicities (repetition counts), selected from a database. We show a principled way to train this model by combining discriminator losses for both a 3D object arrangement representation and a 2D image-based representation. We demonstrate the effectiveness of our scene representation and the deep learning method on benchmark datasets. We also show the applications of this generative model in scene interpolation and scene completion.
研究动机与目标
- 解决从具有高几何与结构可变性的异构数据中学习参数化3D场景模型的挑战。
- 通过引入前馈架构联合优化场景布局,克服顺序或体素化3D生成方法的局限性。
- 开发一种混合表示方法,结合3D物体排列(位置、朝向、尺寸、多重性)与2D图像监督,以提升真实感与一致性。
- 通过引入针对3D与2D监督信号的双判别器,实现从有限的真实世界3D场景数据中有效训练。
- 在场景插值与补全任务中展示应用效果,证明其生成结果在语义与结构上均超越训练数据中最近邻样本的水平。
提出的方法
- 将3D场景表示为物体属性矩阵(位置、朝向、尺寸、类别、数量),实现复杂排列的向量化与可微分编码。
- 设计一个稀疏连接的前馈神经网络,将低维潜在向量(例如标准正态分布)映射到场景表示,相比全连接层可减少过拟合。
- 使用三种损失联合训练生成器:排列自编码器损失、3D排列判别器损失,以及从投影2D视图获得的图像判别器损失。
- 基于真实与生成场景表示之间的逐元素矩阵乘积设计一致性损失,以强化结构保真度。
- 通过随机梯度下降优化生成器,使用超参数 α = 1e-3 平衡重建与对抗目标。
- 利用多视角2D监督以保留局部视图依赖性模式并提升真实感,同时3D排列损失确保几何与拓扑一致性。
实验结果
研究问题
- RQ1前馈式深度生成模型能否有效从低维潜在空间合成多样且逼真的3D室内场景?
- RQ2将3D物体排列表示与2D图像监督相结合,相较于单模态方法,如何提升场景生成质量与一致性?
- RQ3在多样性、真实感与推理速度方面,该混合表示在多大程度上优于顺序或体素化生成方法?
- RQ4所提方法在场景插值与补全任务中是否具备泛化能力,并产生语义上合理的结果?
- RQ5稀疏连接架构在保持复杂3D场景配置表达能力的同时,如何缓解过拟合问题?
主要发现
- 所提模型生成的3D场景在拓扑与几何上表现出显著的多样性,超越了训练数据中的最近邻样本,如图1所示。
- 与基线循环方法相比,该模型推理速度更快(每场景1–2秒),而基线方法平均耗时76–83秒。
- 场景补全结果表明,即使在匹配物体数量的约束下,其生成结果在语义连贯性与物体对局部兼容性方面仍优于[Fisher et al., 2012]与[Kermani et al., 2016]。
- 混合训练方案——结合3D排列与2D图像判别器——相比单模态监督,能生成更真实且一致的场景布局。
- 前馈架构支持所有场景因素的联合优化,避免了顺序生成方法中常见的误差传播问题。
- 定性评估表明,该模型能够捕捉复杂场景模式,并生成合理排列,包括同一物体类别的多个实例。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。