[논문 리뷰] Ctrl-Room: Controllable Text-to-3D Room Meshes Generation with Layout Constraints
Ctrl-Room는 자연어 프롬프트에서 고해상도이고 기하학적으로 타당한 3D 실내 메시를 생성하기 위해 레이아웃 제약이 가해진 확산 모델을 활용하는 텍스트-3D 실내 메시 생성 프레임워크를 제안한다. 시나리오 코드 노이즈 제거 네트워크, 다중 시점 기반 확산 기반 외관 생성 파이pline, 마스크 유도 편집 모듈을 결합함으로써 최신 기술에 비해 뛰어난 시각적 품질과 3D 구조의 완전성을 달성한다.
Text-driven 3D indoor scene generation is useful for gaming, the film industry, and AR/VR applications. However, existing methods cannot faithfully capture the room layout, nor do they allow flexible editing of individual objects in the room. To address these problems, we present Ctrl-Room, which can generate convincing 3D rooms with designer-style layouts and high-fidelity textures from just a text prompt. Moreover, Ctrl-Room enables versatile interactive editing operations such as resizing or moving individual furniture items. Our key insight is to separate the modeling of layouts and appearance. Our proposed method consists of two stages: a Layout Generation Stage and an Appearance Generation Stage. The Layout Generation Stage trains a text-conditional diffusion model to learn the layout distribution with our holistic scene code parameterization. Next, the Appearance Generation Stage employs a fine-tuned ControlNet to produce a vivid panoramic image of the room guided by the 3D scene layout and text prompt. We thus achieve a high-quality 3D room generation with convincing layouts and lively textures. Benefiting from the scene code parameterization, we can easily edit the generated room model through our mask-guided editing module, without expensive edit-specific training. Extensive experiments on the Structured3D dataset demonstrate that our method outperforms existing methods in producing more reasonable, view-consistent, and editable 3D rooms from natural language prompts.
연구 동기 및 목표
- 정밀한 레이아웃 제어를 통해 제어 가능하고 텍스트 조건 기반의 3D 실내 메시 생성을 가능하게 한다.
- 부분적인 시나리오 기술에서 기하학적으로 일관되고 시각적으로 현실적인 3D 실내를 생성하는 과제를 해결한다.
- 레이아웃 인식 확산 모델링과 파노라마 재구성 통합을 통해 3D 구조의 완전성과 시각적 품질을 향상시킨다.
- 마스크 유도 인painting 및 잠재 공간 최적화 파이pline을 통해 3D 실내 메시의 상호작용 편집을 지원한다.
- 사용자 평가 및 정량적 비교를 통해 기존 방법에 비해 2D 파노라마 품질과 3D 메시 정밀도에서 뛰어난 성능을 보이는 프레임워크를 제공한다.
제안 방법
- 노이즈가 섞이고 부분적인 텍스트 프롬프트에서 1D 컨volutional U-Net 아키텍처와 주의 메커니즘 블록을 활용한 IDDPM 기반의 시나리오 코드 노이즈 제거 네트워크를 사용하여 구조적인 3D 시나리오 코드를 생성한다. 이는 전역적이고 의미적인 맥락을 모델링한다.
- 시나리오 코드는 벽과 가구를 노드로 인코딩하며, 각 노드는 클래스 레이블, 3D 중심, 크기, 방향(余弦 및 사인 표현)을 포함한다. 고정된 노드 수를 유지하기 위해 패딩이 적용된다.
- 레이아웃 조건 기반 시나리오 코드에서 고해상도이고 루프 일관성이 있는 RGB 파노라마를 생성하기 위해 다중 시점 확산 모델(MVDiffusion)을 사용한다. DDIM 샘플링을 100단계로 사용하고 90° 회전 증강 기법을 적용한다.
- 파노라마 재구성 모듈은 깊이 추정 및 표면 재구성 기반으로 다중 시점 이미지를 융합하여 360° 메시 생성을 가능하게 한다.
- 마스크 유도 편집 모듈은 미세 조정된 Control-Seg 모델을 사용해 편집된 영역을 인painting하고 잠재 공간을 최적화하여 질감 일관성을 유지하며 상호작용 가능한 시각화 편집을 가능하게 한다.
- 텍스트-파노라마 생성(텍스트2라이트를 통한), 레이아웃 모델링, 3D 메시 재구성 요소를 통합하여 종단 간 제어 가능한 3D 실내 생성을 위한 유일한 파이pline를 구성한다.
실험 결과
연구 질문
- RQ1확산 기반 모델은 레이아웃 제약을 준수하면서 부분적인 텍스트 기술에서 기하학적으로 타당한 3D 실내 메시를 생성할 수 있는가?
- RQ2레이아웃 인식 시나리오 코드 노이즈 제거의 통합은 무조건적 생성에 비해 3D 구조의 완전성과 시각적 정밀도를 얼마나 향상시키는가?
- RQ3다중 시점 확산 합성은 3D 실내 생성에서 파노라마 일관성과 시각적 품질을 얼마나 향상시키는가?
- RQ4잠재 공간 최적화와 마스크 유도 인painting을 통한 3D 실내 메시의 상호작용 편집은 효과적으로 지원될 수 있는가?
- RQ5레이아웃 제약과 다중 시점 일관성은 생성된 3D 실내의 뛰어난 시각적 품질과 구조적 일관성에 얼마나 기여하는가?
주요 결과
- 사용자 연구에서 Ctrl-Room는 평균 5점 만점에 4.3점의 뛰어난 시각적 품질과 평균 5점 만점에 4.1점의 3D 구조 완전성을 확보하여 Text2Room 및 MVDiffusion 등의 베이스라인을 뛰어넘었다.
- Text2Light(경계 불일치 문제 악화)와 MVDiffusion(합리적인 레이아웃 복구 실패)에 비해 더 뛰어난 레이아웃 타당성과 더 적은 아티팩트를 가진 파노라마를 생성했다.
- 주의 블록을 갖춘 시나리오 코드 노이즈 제거 네트워크를 사용함으로써 부분적인 텍스트 프롬프트에서 공간 관계와 의미 맥락을 효과적으로 모델링할 수 있었다.
- 90° 회전 증강 기법을 적용한 다중 시점 확산 파이pline는 루프 일관성이 있는 파노라마를 생성하여 이미지 경계에서의 시각적 아티팩트를 감소시켰다.
- 마스크 유도 모듈을 통한 상호작용 편집은 질감 일관성을 효과적으로 유지하며 현실적인 시각화 수정을 가능하게 했으며, 정성적 결과에서 이를 확인할 수 있었다.
- 프레임워크는 침실(N=23개 노드)과 거실(N=45개 노드) 모두에 대해 우수한 일반화 성능을 보이며, 실내 유형 간 일관된 성능을 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.