Skip to main content
QUICK REVIEW

[논문 리뷰] Text Semantics to Image Generation: A method of building facades design base on Stable Diffusion model

Haoran Ma|arXiv (Cornell University)|2023. 02. 23.
Image Retrieval and Classification Techniques인용 수 6
한 줄 요약

이 논문은 제어넷을 활용한 LoRA로 미세조정한 스테ble 디퓨전과 다중 네트워크 텍스트-페이스 이미지 생성 방법을 제안하여 제어성과를 향상시킨다. 이 방법은 미세조정 비용을 크게 감소시키고 아키텍처 설계 제어를 향상시켜 다양한 건축 스타일에서 우수한 출력 일관성을 보여준다.

ABSTRACT

Stable Diffusion model has been extensively employed in the study of archi-tectural image generation, but there is still an opportunity to enhance in terms of the controllability of the generated image content. A multi-network combined text-to-building facade image generating method is proposed in this work. We first fine-tuned the Stable Diffusion model on the CMP Fa-cades dataset using the LoRA (Low-Rank Adaptation) approach, then we ap-ply the ControlNet model to further control the output. Finally, we contrast-ed the facade generating outcomes under various architectural style text con-tents and control strategies. The results demonstrate that the LoRA training approach significantly decreases the possibility of fine-tuning the Stable Dif-fusion large model, and the addition of the ControlNet model increases the controllability of the creation of text to building facade images. This pro-vides a foundation for subsequent studies on the generation of architectural images.

연구 동기 및 목표

  • 확산 모델을 사용하여 건축 페이스 설계에서 텍스트-이미지 생성의 제어성을 향상시키는 것.
  • 건축 적용을 위한 대규모 스테이블 디퓨전 모델의 미세조정에 소요되는 계산 비용을 줄이는 것.
  • 미세조정된 스테이블 디퓨전과 제어넷을 통합하여 구조적 및 스타일적 제어성을 향상시키는 것.
  • 다양한 텍스트 프롬프트와 제어 전략이 페이스 생성 품질에 미치는 영향을 평가하는 것.

제안 방법

  • LoRA(Low-Rank Adaptation) 기법을 사용하여 CMP 페이스 데이터셋에 기반해 스테이블 디퓨전 모델을 미세조정하여 학습 비용을 절감한다.
  • 구조적 또는 레이아웃 조건에 기반해 이미지 생성을 안내하기 위해 제어넷 모델을 통합한다.
  • 다양한 건축 스타일을 묘사하는 텍스트 프롬프트를 적용하여 이미지 생성 과정을 조건화한다.
  • 페이스 특성에 맞게 원본 모델의 기능을 유지하면서도 적응할 수 있도록 CMP 페이스 데이터셋에 대해 LoRA 어댑터를 훈련시킨다.
  • 텍스트 조건과 제어넷의 레이아웃 또는 에지 가이던스를 결합하여 더 정확한 페이스 설계를 생성한다.
  • 다양한 건축 스타일과 제어 전략을 기반으로 출력물을 평가하여 일관성과 품질을 분석한다.

실험 결과

연구 질문

  • RQ1LoRA 미세조정은 건축 페이스 생성에서 스테이블 디퓨전 모델의 효율성과 성능에 어떤 영향을 미치는가?
  • RQ2제어넷을 추가함으로써 텍스트-페이스 이미지 생성의 제어성은 어느 정도 향상되는가?
  • RQ3다양한 건축 스타일 묘사는 생성된 페이스의 품질과 정확성에 어떤 영향을 미치는가?
  • RQ4텍스트 전용 전략과 텍스트+제어 전략의 비교 성능은 일관된 페이스 생성에서 어떻게 나타나는가?

주요 결과

  • LoRA 미세조정 기법은 스테이블 디퓨전 모델의 미세조정 과정에서 계산 비용을 크게 감소시키고 치명적 기억 상실의 위험을 줄인다.
  • 제어넷의 통합은 생성된 페이스 이미지의 구조적 정확성과 제어성을 향상시킨다.
  • LoRA와 제어넷을 병합한 방식을 사용할 경우, 다양한 건축 스타일 묘사에 대해 생성된 페이스가 일관되게 일치함을 확인할 수 있다.
  • 특히 복잡한 스타일 프롬프트 상황에서 텍스트 전용 생성 방식에 비해 더 일관되고 스타일적으로 정확한 페이스를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.