[논문 리뷰] SceneX: Procedural Controllable Large-scale Scene Generation
Scene𝒳는 대규모이면서 프로시저성이고 제어 가능한 3D 장면 생성 프레임워크로, 대규모 언어 모델(Large Language Models, LLMs)에 의해 구동되며, 비전문가가 자연어 지시어를 통해 고해상도의 사진처럼 현실적인 장면—예를 들어 2.5 km × 2.5 km 도시—을 생성할 수 있도록 한다. 이 시스템은 프로시저 자산과 API 문서를 담은 정제된 라이브러리인 PCGBench와 사용자 지시에 기반해 실행 가능한 Blender 액션을 생성하는 LLM 기반 에이전트인 PCGPlanner을 활용하여, 장면 제작 시간을 수주에서 수시간으로 단축시키며, 세밀한 편집과 스타일 전이를 지원한다.
Developing comprehensive explicit world models is crucial for understanding and simulating real-world scenarios. Recently, Procedural Controllable Generation (PCG) has gained significant attention in large-scale scene generation by enabling the creation of scalable, high-quality assets. However, PCG faces challenges such as limited modular diversity, high expertise requirements, and challenges in managing the diverse elements and structures in complex scenes. In this paper, we introduce a large-scale scene generation framework, SceneX, which can automatically produce high-quality procedural models according to designers' textual descriptions. Specifically, the proposed method comprises two components, PCGHub and PCGPlanner. The former encompasses an extensive collection of accessible procedural assets and thousands of hand-craft API documents to perform as a standard protocol for PCG controller. The latter aims to generate executable actions for Blender to produce controllable and precise 3D assets guided by the user's instructions. Extensive experiments demonstrated the capability of our method in controllable large-scale scene generation, including nature scenes and unbounded cities, as well as scene editing such as asset placement and season translation.
연구 동기 및 목표
- 점진적인 3D 장면 생성 기술의 학술적 연구와 산업적 구현 간 격차를 해소하기 위해, 점근적 기반의 3D 원소(예: 점군 또는 레디언스 필드)가 아닌 프로시저 모델링을 사용함으로써 이를 달성하고자 한다.
- 프로시저 콘텐츠 생성(PCG)의 높은 학습 곡선을 줄이기 위해, 비전문가가 자연어 지시어를 통해 복잡한 장면을 생성할 수 있도록 하는 것을 목표로 한다.
- LLM 기반 에이전트 파이프라인을 통해 고해상도, 제어 가능하고 편집 가능한 대규모 장면 생성—자산 배치 및 계절 스타일 전이 포함—을 가능하게 하고자 한다.
- LLM을 Blender와 같은 프로시저 생성 도구와 통합하여 효율성과 사용성을 향상시키는 가용성 있고 재사용 가능한 프레임워크를 개발하고자 한다.
제안 방법
- 이 프레임워크는 두 가지 핵심 구성 요소로 이루어져 있다: PCGBench는 토양, 도시, 식생 등의 프로시저 자산과 프로시저 모델링을 위한 수천 개의 수작업 API 문서 기입 사례를 포함한 정제된 레포지터리이다.
- PCGPlanner는 사용자 지시에 기반해 실행 가능한, 단계별 액션을 생성하는 LLM 기반 에이전트로, 역할, 작업, 예시, 문서 구성 요소를 포함한 프롬프트 템플릿을 사용한다.
- 프롬프트 엔지니어링 전략은 역할 정의, 작업 명시, 예시, API 문서를 포함한 구조화된 템플릿을 활용하여 계획의 정확성과 실행 가능성 향상을 도모한다.
- 시스템은 LLMs(예: GPT-4, Mistral)를 활용해 자연어 프롬프트를 해석하고, Blender 내에서 유효한 프로시저 생성 명령어로 매핑함으로써 정확하고 실행 가능한 액션 시퀀스를 보장한다.
- 수정된 사용자 지시에 기반해 액션을 재계획함으로써 반복적 편집과 스타일 전이(예: 계절 번역)를 지원한다.
- 평가에서는 50개의 장면 및 50개의 자산 생성 작업에 대해 성공률(SR@1)과 실행 가능성 비율(ER@1)을 기준으로 수행되며, 다양한 LLM들 간의 정량적 벤치마킹이 실시된다.
실험 결과
연구 질문
- RQ1LLM 기반 에이전트는 전문가 수준의 프로시저 모델링 지식 없이도 자연어 기반 기술서에서 실행 가능한 고해상도 프로시저 3D 장면을 생성할 수 있는가?
- RQ2예시, 역할 정의 등의 구조화된 API 문서 및 프롬프트 구성 요소의 포함 여부가 생성된 프로시저 계획의 정확성과 실행 가능성에 어떤 영향을 미치는가?
- RQ3텍스트 입력만으로도 세부 기하학, 텍스처, 조명을 갖춘 대규모 현실감 있는 장면(예: 2.5 km × 2.5 km 도시)을 얼마나 잘 생성할 수 있는가?
- RQ4GPT-4, Mistral, Llama2와 같은 다양한 LLM들이 복잡한 3D 장면의 정확하고 실행 가능한 프로시저 생성 계획을 생성하는 데서 성능에 어떤 차이를 보이는가?
- RQ5시스템은 높은 계획 정확성과 장면 품질을 유지하면서도 자산 재배치 및 계절 스타일 전이와 같은 세밀한 편집 작업을 지원할 수 있는가?
주요 결과
- 제안된 Scene𝒳 프레임워크는 전문 PCG 엔지니어가 2주 이상 소요하던 2.5 km × 2.5 km 도시 생성 작업을 비전문가 사용자에게서 몇 시간 내로 단축시켰다.
- GPT-4는 자연 장면 생성에서 가장 높은 성공률(SR@1 = 86.05%)과 실행 가능성 비율(ER@1 = 86.00%)을 기록하여, Mistral 및 Llama2와 같은 다른 LLM들을 압도적으로 앞섰다.
- 예시와 문서 자료를 포함한 구조화된 프롬프트 구성 요소의 사용은 계획 성공률을 크게 향상시켰으며, ER@1은 구성 요소 없이 16.00%에서 전체 템플릿을 사용할 경우 94.00%로 상승했다.
- Mistral은 GPT-4에 비해 하드웨어 요구 사항이 낮아, 강력한 오픈소스 대안으로 부상했으며, 장면 생성에서 ER@1 76.00%, SR@1 68.42%의 성능을 기록했다.
- 이 프레임워크는 자산 배치 및 계절 번역을 포함한 편집 작업에서도 뛰어난 성능을 보였으며, 다양한 사용자 지시어에 걸쳐 높은 계획 정확도를 유지했다.
- 시스템의 성공 여부는 근본적인 PCGBench와 API 문서의 품질에 크게 의존하며, 복잡한 다중 구성 요소 장면에 대해 LLM이 더 높은 추론 요구를 감당해야 할 경우 성능 저하가 발생한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.