[논문 리뷰] HouseDiffusion: Vector Floorplan Generation via a Diffusion Model with Discrete and Continuous Denoising
HouseDiffusion는 연속적인 2D 좌표와 이산적인 모서리 위치를 동시에 노이즈 제거하는 방식으로, 그래프 제약 조건이 부여된 입력(예: 버블 다이어그램)에서 직접 벡터 평면도를 생성하는 확산 모델을 제안한다. RPLAN 데이터셋에서 다양성, 호환성, 현실성 측면에서 최신 기술을 압도적으로 뛰어넘는 성능을 달성하며, 후처리 없이도 모서리 수와 비맨하탄 구조를 제어할 수 있다.
The paper presents a novel approach for vector-floorplan generation via a diffusion model, which denoises 2D coordinates of room/door corners with two inference objectives: 1) a single-step noise as the continuous quantity to precisely invert the continuous forward process; and 2) the final 2D coordinate as the discrete quantity to establish geometric incident relationships such as parallelism, orthogonality, and corner-sharing. Our task is graph-conditioned floorplan generation, a common workflow in floorplan design. We represent a floorplan as 1D polygonal loops, each of which corresponds to a room or a door. Our diffusion model employs a Transformer architecture at the core, which controls the attention masks based on the input graph-constraint and directly generates vector-graphics floorplans via a discrete and continuous denoising process. We have evaluated our approach on RPLAN dataset. The proposed approach makes significant improvements in all the metrics against the state-of-the-art with significant margins, while being capable of generating non-Manhattan structures and controlling the exact number of corners per room. A project website with supplementary video and document is here https://aminshabani.github.io/housediffusion.
연구 동기 및 목표
- 래스터화나 후처리 없이도 종단 간(end-to-end) 직접적인 벡터 평면도 생성을 가능하게 하기 위해.
- 이산적 노이즈 제거를 통해 정확한 기하 관계(예: 수직, 공유 벽)를 유지하기 위해.
- 특정 방의 모서리 수를 정확히 지정하는 등의 탄력적인 설계 제어를 지원하기 위해.
- 기하 정확도와 구조적 호환성 측면에서 한계가 있는 기존 GAN 기반 모델인 House-GAN++을 개선하기 위해.
- 고도의 현실성과 다양성을 유지하면서도 비맨하탄 평면도를 생성할 수 있도록 하기 위해.
제안 방법
- 모델은 컴포넌트별 자기주의(Compontent-wise Self Attention, CSA), 글로벌 자기주의(Global Self Attention, GSA), 상관관계 교차주의(Relational Cross Attention, RCA)를 포함한 트랜스포머 기반 아키텍처를 사용한다.
- 두 가지 브랜치 노이즈 제거 과정을 적용한다: 정밀한 공간 역전을 위해 연속적인 좌표 노이즈 제거, 기하 제약 조건을 강제하기 위해 최종 모서리 위치의 이산적 노이즈 제거.
- 입력은 방과 문에 대한 1차원 다각형 루프로 표현되며, 구조적 레이아웃을 안내하기 위해 어텐션 마스크를 통해 그래프 제약 조건이 인코딩된다.
- 이산적 노이즈 제거 중 기하 인cidnet 관계(예: 평행, 수직) 탐지 능력을 향상시키기 위해 벽 점에 대해 모서리 증강(corner augmentation)을 적용한다.
- 이산적 노이즈 제거 헤드는 최종 32단계에서만 활성화되어 정밀도와 정확도의 균형을 맞춘다.
- 연속 좌표에 대한 L2 손실과 이산적 모서리 예측에 대한 교차 엔트로피 손실을 조합하여 RPLAN 데이터셋에서 종단 간(end-to-end)으로 훈련한다.
실험 결과
연구 질문
- RQ1확산 모델이 평행성, 수직성 등의 기하 인cidnet 관계를 유지하면서도 고해상도의 벡터 평면도를 효과적으로 생성할 수 있는가?
- RQ2연속적 및 이산적 노이즈 제거를 병합함으로써 순수하게 연속적 또는 이산적 접근에 비해 기하 정확도가 어떻게 향상되는가?
- RQ3모델이 방당 정확한 모서리 수 제어가 가능한 비맨하탄 평면도를 어느 정도의 수준에서 생성할 수 있는가?
- RQ4CSA, GSA, RCA와 같은 다양한 어텐션 메커니즘의 각각의 기여도는 생성된 평면도의 품질, 다양성, 호환성에 어떤 영향을 미치는가?
- RQ5최종 단계에서 이산적 노이즈 제거를 수행할 경우, 조기 또는 미실행된 경우에 비해 구조적 일관성이 얼마나 향상되는가?
주요 결과
- HouseDiffusion는 RPLAN 데이터셋에서 다양성 점수 9.5 ± 0.1, 호환성 점수 2.5 ± 0.0을 기록하며 House-GAN++을 크게 능가한다.
- 제거 실험(ablation study) 결과, 세 어텐션 메커니즘(CSA, GSA, RCA) 중 어느 하나라도 제거하면 성능 저하가 발생하며, 특히 GSA가 현실성과 다양성에 가장 큰 영향을 미친다.
- 이산적 노이즈 제거 헤드를 최종 32단계에서만 활성화할 경우 최적의 성능을 기록하며, 이보다 이르거나 늦게 활성화할 경우 품질이 떨어진다.
- 모서리 증강은 호환성 점수를 0.5점 향상시켜 3.0에서 2.5로, 다양성 점수를 0.5점 향상시켜 10.0에서 9.5로 개선하여 기하 추론 능력 향상에 기여함을 입증한다.
- 그림 7에서 보듯이, 식당의 모서리 수를 증가시키면서도 레이아웃 일관성을 유지하는 비맨하탄 평면도를 성공적으로 생성하였다.
- GSA 레이어를 세 배로 늘인 실험은 병합된 어텐션 메커니즘 대비 열등한 성능을 보이며, 세 가지 어텐션 유형이 모두 필요하다는 점을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.