Skip to main content
QUICK REVIEW

[论文解读] SceneX: Procedural Controllable Large-scale Scene Generation

Mengqi Zhou, Yuxi Wang|arXiv (Cornell University)|Mar 23, 2024
Multimodal Machine Learning Applications被引用 4
一句话总结

Scene𝒳 提出了一套大规模、程序化且可控制的 3D 场景生成框架,由大语言模型(LLMs)驱动,使非专业人士能够通过自然语言指令生成高保真、逼真的场景——例如 2.5 km × 2.5 km 的城市。该系统利用 PCGBench(一个经过筛选的程序化资产与 API 文档库)和 PCGPlanner(一个基于 LLM 的代理,可生成可执行的 Blender 操作),将场景创建时间从数周缩短至数小时,同时支持细粒度编辑与风格迁移。

ABSTRACT

Developing comprehensive explicit world models is crucial for understanding and simulating real-world scenarios. Recently, Procedural Controllable Generation (PCG) has gained significant attention in large-scale scene generation by enabling the creation of scalable, high-quality assets. However, PCG faces challenges such as limited modular diversity, high expertise requirements, and challenges in managing the diverse elements and structures in complex scenes. In this paper, we introduce a large-scale scene generation framework, SceneX, which can automatically produce high-quality procedural models according to designers' textual descriptions. Specifically, the proposed method comprises two components, PCGHub and PCGPlanner. The former encompasses an extensive collection of accessible procedural assets and thousands of hand-craft API documents to perform as a standard protocol for PCG controller. The latter aims to generate executable actions for Blender to produce controllable and precise 3D assets guided by the user's instructions. Extensive experiments demonstrated the capability of our method in controllable large-scale scene generation, including nature scenes and unbounded cities, as well as scene editing such as asset placement and season translation.

研究动机与目标

  • 通过使用程序化建模而非不兼容的 3D 原语(如点云或辐射场),弥合学术界 3D 场景生成与工业部署之间的差距。
  • 通过使非专业人士能够使用自然语言指令生成复杂场景,降低程序化内容生成(PCG)的陡峭学习曲线。
  • 通过 LLM 代理管道实现高保真、可控制且可编辑的大规模场景生成,包括资产布局与季节风格迁移。
  • 开发一个可扩展、可重用的框架,将 LLM 与 Blender 等程序化生成工具集成,提升效率与可用性。

提出的方法

  • 该框架由两个核心组件构成:PCGBench,即一个经过筛选的程序化资产库(如地形、城市、植被)以及数千条手工编写的程序化建模 API 文档条目。
  • PCGPlanner 是一个基于 LLM 的代理,根据用户指令生成可执行的、分步的 Blender 操作,使用包含角色、任务、示例和文档组件的提示模板。
  • 提示工程策略结合了结构化模板,包含角色定义、任务说明、示例和 API 文档,以提升计划的准确性和可执行性。
  • 系统利用 LLM(如 GPT-4、Mistral)解析自然语言提示,并将其映射为 Blender 中有效的程序化生成命令,确保生成的指令序列正确且可执行。
  • 通过基于修改后的用户指令重新规划操作,该框架支持迭代编辑与风格迁移(如季节转换)。
  • 评估通过在 50 个场景和 50 个资产生成任务上测量成功率(SR@1)和可执行率(ER@1)进行,对多种 LLM 进行定量基准测试。

实验结果

研究问题

  • RQ1基于 LLM 的代理是否能够在无需专家级程序化建模知识的情况下,从自然语言描述中生成可执行的、高保真的程序化 3D 场景?
  • RQ2结构化 API 文档和提示组件(如示例、角色)的引入在多大程度上提升了生成程序化计划的准确性和可执行性?
  • RQ3该框架在仅使用文本输入的情况下,能够在多大程度上生成大规模、逼真的场景(如 2.5 km × 2.5 km 的城市),并包含详细的几何结构、纹理与光照?
  • RQ4不同 LLM(如 GPT-4、Mistral、Llama2)在生成复杂 3D 场景的正确且可执行的程序化生成计划方面,性能表现如何?
  • RQ5该系统是否能够在保持高计划准确率和场景质量的前提下,支持细粒度编辑任务,如资产重新定位与季节风格迁移?

主要发现

  • 所提出的 Scene𝒳 框架将生成 2.5 km × 2.5 km 城市所需的时间,从专业 PCG 工程师需超过两周,缩短至非专业人士仅需数小时。
  • GPT-4 在自然场景生成中取得了最高的成功率(SR@1 = 86.05%)和可执行率(ER@1 = 86.00%),优于其他 LLM(包括 Mistral 和 Llama2)。
  • 结构化提示组件的使用——尤其是示例和文档——显著提升了计划成功率,可执行率(ER@1)从无组件时的 16.00% 提升至完整模板下的 94.00%。
  • Mistral 表现为强劲的开源替代方案,其在场景生成中实现 76.00% 的 ER@1 和 68.42% 的 SR@1,且对硬件要求低于 GPT-4。
  • 该框架在编辑任务中表现出稳健性能,包括资产布局与季节转换,能在多样化的用户指令下保持高计划准确率。
  • 系统的成功高度依赖于底层 PCGBench 和 API 文档的质量,当 LLM 被要求处理复杂、多组件场景时,由于推理需求增加,性能会下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。