[论文解读] Human-centric Indoor Scene Synthesis Using Stochastic Grammar
本文提出一种以人为中心的3D室内场景合成方法,采用随机语法模型——属性化空间And-Or图(S-AOG),联合建模物体、功能属性与人类活动。通过整合马尔可夫随机场以捕捉上下文关系,并利用马尔可夫链蒙特卡洛采样,生成多样化、逼真的布局,且具备完美的像素级真实标签,其在视觉真实感、功能属性准确性,以及人工评分的功能性与自然度方面均优于当前最先进方法。
We present a human-centric method to sample and synthesize 3D room layouts and 2D images thereof, to obtain large-scale 2D/3D image data with perfect per-pixel ground truth. An attributed spatial And-Or graph (S-AOG) is proposed to represent indoor scenes. The S-AOG is a probabilistic grammar model, in which the terminal nodes are object entities. Human contexts as contextual relations are encoded by Markov Random Fields (MRF) on the terminal nodes. We learn the distributions from an indoor scene dataset and sample new layouts using Monte Carlo Markov Chain. Experiments demonstrate that our method can robustly sample a large variety of realistic room layouts based on three criteria: (i) visual realism comparing to a state-of-the-art room arrangement method, (ii) accuracy of the affordance maps with respect to groundtruth, and (ii) the functionality and naturalness of synthesized rooms evaluated by human subjects. The code is available at https://github.com/SiyuanQi/human-centric-scene-synthesis.
研究动机与目标
- 解决2D/3D场景数据集中人工数据采集的局限性以及基于传感器的标注噪声问题。
- 生成大规模、高质量的3D室内场景,具备完美的像素级标注,以用于AI模型训练。
- 在统一的概率框架中建模功能分组、支持关系以及人-物交互。
- 基于功能属性分布与活动规划,实现物体与人类位置的联合采样。
- 生成反映以人为中心的空间推理的逼真、功能合理且自然排列的室内场景。
提出的方法
- 该方法使用属性化空间And-Or图(S-AOG)表示室内场景,终端节点代表物体,内部/外部属性包括尺寸、位置、朝向及人类交互信息。
- 通过在终端节点上建立马尔可夫随机场(MRFs),对物体之间的上下文关系(如功能分组与支撑关系)进行建模,以编码以人为中心的约束条件。
- 利用最大似然估计从真实室内场景数据集中学习场景的联合概率分布。
- 采用马尔可夫链蒙特卡洛(MCMC)采样,通过交替采样人类位置与物体配置,基于学习到的S-AOG生成新布局。
- 通过建模家具之间的人类轨迹,支持动态人类活动规划,从而提升布局的自然度。
- 将合成场景渲染为2D图像,生成包含深度、表面法线与语义分割的像素级真实标签。
实验结果
研究问题
- RQ1随机语法规则模型能否有效捕捉以人为中心的室内场景的结构与上下文复杂性?
- RQ2与现有基于优化的方法相比,所提出的S-AOG模型在生成多样化、逼真且功能有效的房间布局方面表现如何?
- RQ3合成场景在多大程度上保留了与真实世界数据一致的准确功能属性分布?
- RQ4人类受试者对本方法生成的场景在功能性和自然度方面的评分,相较于基线方法如何?
- RQ5该方法能否在多个房间类别中实现泛化,同时保持结构与语义一致性?
主要发现
- 使用ResNet-152分类器在俯视图语义分割图上,本方法在区分合成场景与SUNCG场景时达到76.18%的准确率,表明其视觉真实感优于当前最先进优化方法(Yu等人的方法准确率为87.49%)。
- 合成场景的功能属性图与SUNCG相比,总变差与Hellinger距离均接近0,表明分布相似性极强,尤其在功能型房间中表现突出。
- 人类受试者对本方法在功能性和自然度方面的评分显著更高(平均分4.3/5),优于随机采样与基于物体关系的建模方法。
- 该方法成功生成了10种房间类别中多样化布局,包括具有可变物体数量的复杂功能分组。
- 单个场景采样耗时20–40分钟(20,000次MCMC迭代),在标准PC上渲染640×480图像耗时12–20分钟,尽管计算成本较高,但证明了其可行性。
- 该框架可生成大规模2D/3D数据集,具备完美的像素级真实标签,支持视觉、机器人学与3D内容创作等下游任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。