Skip to main content
QUICK REVIEW

[论文解读] Language-driven Scene Synthesis using Multi-conditional Diffusion Model

An Vuong, Minh Nhat Vu|arXiv (Cornell University)|Oct 24, 2023
Human Motion and Animation被引用 4
一句话总结

本文提出了一项基于语言的场景生成任务,通过文本提示、人体动作和现有物体生成3D场景,利用一种新颖的多条件扩散模型并引入显式引导点以指导去噪过程。该方法在PRO-teXt和HUMANISE数据集上均达到最先进性能,FID和3D IP指标显著优于基线方法,并可通过文本命令实现对象替换、形状变换等高级编辑应用。

ABSTRACT

Scene synthesis is a challenging problem with several industrial applications. Recently, substantial efforts have been directed to synthesize the scene using human motions, room layouts, or spatial graphs as the input. However, few studies have addressed this problem from multiple modalities, especially combining text prompts. In this paper, we propose a language-driven scene synthesis task, which is a new task that integrates text prompts, human motion, and existing objects for scene synthesis. Unlike other single-condition synthesis tasks, our problem involves multiple conditions and requires a strategy for processing and encoding them into a unified space. To address the challenge, we present a multi-conditional diffusion model, which differs from the implicit unification approach of other diffusion literature by explicitly predicting the guiding points for the original data distribution. We demonstrate that our approach is theoretically supportive. The intensive experiment results illustrate that our method outperforms state-of-the-art benchmarks and enables natural scene editing applications. The source code and dataset can be accessed at https://lang-scene-synth.github.io/.

研究动机与目标

  • 为填补现有场景生成方法在整合多模态信息(文本、人体动作和现有物体)方面的空白,提出一种新的基于语言的场景生成任务。
  • 克服现有单条件生成方法依赖潜在空间中隐式融合条件的局限性。
  • 开发一种基于3D点云的场景表示方法,同时捕捉空间位置与形状信息,以实现更精确和细致的场景生成。
  • 通过自然语言命令实现用户可操作、直观的场景编辑。

提出的方法

  • 提出一种用于3D点云生成的多条件扩散模型,通过显式建模引导点来引导去噪过程,与先前工作中隐式统一条件的方法不同。
  • 引入一种新概念——'引导点',其从文本、动作和物体输入中预测得出,并直接作用于扩散过程的去噪步骤。
  • 采用统一的编码器架构,结合CLIP用于文本、PoseNet用于人体动作、PointNet++/DGCNN用于3D点云,并通过交叉注意力机制融合多条件信息。
  • 使用带有引导点条件注入的去噪U-Net,引导反向扩散过程生成语义和物理上合理的场景。
  • 采用基于对比学习的损失函数,提升文本提示与生成3D场景之间的对齐度。
  • 通过消融研究和用户研究验证引导点及各组件选择的有效性。

实验结果

研究问题

  • RQ1多条件扩散模型能否通过联合依赖于文本提示、人体动作和现有物体来有效生成3D场景?
  • RQ2与以往方法中在潜在空间内隐式统一条件相比,显式预测引导点在多条件扩散模型中如何提升生成质量?
  • RQ3在多大程度上可以通过文本命令实现基于语言的场景编辑,如对象替换、形状变换和位移调整?
  • RQ4不同主干网络架构(如PointNet++、DGCNN)和文本编码器(如CLIP、BERT)对模型性能有何影响?
  • RQ5通过用户研究验证,所提出方法是否在多样化的数据集和用户偏好下具备良好的泛化能力?

主要发现

  • 所提出的LSDM模型在PRO-teXt数据集上达到3D IP为0.0402、FID为161.05,显著优于所有基线方法,包括ATISS、SUMMON和MIME。
  • 在HUMANISE数据集上,LSDM的FID相比最先进方法至少降低35%,表明在场景真实感方面有显著提升。
  • CLIP、POSA与PointNet++的组合在EMD和F1得分上表现最佳,CD指标仅比最优配置下降0.1866单位。
  • 消融研究证实,当与CLIP和PointNet++结合时,POSA在F1得分上比P2R高出近三倍。
  • 用户研究表明,LSDM生成的场景在自然度、无碰撞性和意图匹配度方面显著优于基线方法。
  • 该模型在不同人体姿态帧数下表现稳定,即使仅使用单帧姿态信息,性能下降也极小,表明其具备鲁棒性与高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。