Skip to main content
QUICK REVIEW

[논문 리뷰] AI Art in Architecture

Joern Ploennigs, Markus Berger|arXiv (Cornell University)|2022. 12. 19.
Aesthetic Perception and Analysis인용 수 15
한 줄 요약

이 논문은 아키텍처 디자인을 위한 확산 기반 AI 아트 플랫폼—Midjourney, DALL-E 2, 및 StableDiffusion를 평가하며, 아이디어 도출, 스케치, 모델링 작업 등 다양한 영역에서의 능력을 분석한다. 4000만 건의 Midjourney 쿼리에 대한 자연어 처리(NLP) 분석과 함께 질적 사례 연구를 병행하여 플랫폼 별 강점과 특성을 규명하고, 각 도구의 고유한 출력 품질과 프롬프트 민감도를 활용하는 실용적이고 하이브리드 워크플로우를 개발한다. 이는 내부 및 외부 디자인에 적용 가능하다.

ABSTRACT

Recent diffusion-based AI art platforms are able to create impressive images from simple text descriptions. This makes them powerful tools for concept design in any discipline that requires creativity in visual design tasks. This is also true for early stages of architectural design with multiple stages of ideation, sketching and modelling. In this paper, we investigate how applicable diffusion-based models already are to these tasks. We research the applicability of the platforms Midjourney, DALL-E 2 and StableDiffusion to a series of common use cases in architectural design to determine which are already solvable or might soon be. We also analyze how they are already being used by analyzing a data set of 40 million Midjourney queries with NLP methods to extract common usage patterns. With this insights we derived a workflow to interior and exterior design that combines the strengths of the individual platforms.

연구 동기 및 목표

  • 주요 AI 아트 플랫폼—Midjourney, DALL-E 2, 및 StableDiffusion—의 현재 아키텍처 디자인 작업에 대한 적용 가능성을 평가하기 위해.
  • 대규모 자연어 처리(NLP) 기법을 활용해 4000만 건의 공개된 Midjourney 쿼리를 분석함으로써 실질적인 사용 패턴을 이해하기 위해.
  • 현재 기술로 해결 가능한 아키텍처 디자인 용도와 향후 모델 개선으로 가능해질 수 있는 용도를 식별하기 위해.
  • 각 AI 모델의 강점을 최적화하여 아키텍처 시각화 및 아이디어 도출에 활용할 수 있는 실용적인 하이브리드 워크플로우를 개발하기 위해.
  • 현재 AI 모델이 바닥도면이나 공간 배치와 같은 의미론적 아키텍처 콘텐츠를 다룰 때의 한계를 탐색하고, BIM 데이터 기반의 의미론적 인식 훈련의 필요성을 규명하기 위해.

제안 방법

  • 공통적인 아키텍처 디자인 용도에 대해 Midjourney, DALL-E 2, 및 StableDiffusion의 세 가지 주요 AI 이미지 생성 플랫폼을 질적 평가하였다.
  • 4000만 건의 공개된 Midjourney 쿼리 데이터셋을 대상으로 자연어 처리(NLP) 분석을 수행하여 일반적인 아키텍처 프롬프트, 사용 패턴, 쿼리 성공률을 추출하였다.
  • 각 플랫폼의 강점을 조합한 하이브리드 워크플로우를 개발하고 테스트하였다: Midjourney는 고시각적 정밀도의 개념 예술을 위해, DALL-E 2는 정확한 텍스트-이미지 일치를 위해, StableDiffusion는 인painting 및 이미지 편집을 통한 세밀한 제어를 위해 사용하였다.
  • 초기 텍스트 프롬프트를 기반으로 이미지 간 생성(img2img), 인페인팅(inpainting), 아웃페인팅(outpainting) 기법을 활용하여 아키텍처 개념을 정밀하게 보완하고 확장하였다.
  • 확산 모델 원리—CLIP 기반 텍스트 인코딩을 활용한 정방향 및 역방향 확산 과정—을 적용하여 모델 행동과 출력 일관성을 이해하였다.
  • 바닥도면, 외관 디자인, 복잡한 공간 배치를 포함한 사례 연구를 통해 모델 성능을 평가하여 실패 모드와 한계를 규명하였다.

실험 결과

연구 질문

  • RQ1확산 기반 AI 아트 플랫폼이 현재 아키텍처 디자인 작업을 얼마나 효과적으로 지원할 수 있는가?
  • RQ2사용자들은 실질적으로 아키텍처 콘텐츠를 위한 AI 아트 플랫폼에 어떻게 프롬프트를 입력하는가? 그리고 대규모 사용 데이터에서 드러나는 언어 패턴은 무엇인가?
  • RQ3Midjourney, DALL-E 2, 및 StableDiffusion가 아키텍처적으로 의미 있는 이미지를 생성할 때의 주요 강점과 한계는 무엇인가?
  • RQ4AI 생성 이미지가 스케치 및 개념 모델링을 포함한 초기 단계 아키텍처 아이디어 도출에 어느 정도 기여할 수 있는가?
  • RQ5AI 생성 아키텍처 이미지에서 나타나는 주요 실패 유형은 무엇이며, 이는 현재 모델의 의미론적 이해 부족과 어떻게 관련이 있는가?

주요 결과

  • 4000만 건의 Midjourney 쿼리에 대한 자연어 처리(NLP) 분석 결과, 아키텍처 프롬프트는 종종 스타일, 재료, 공간 서술어로 구성되며, 만족스러운 결과를 얻기 위해 평균 3~5회 반복이 필요하다는 점이 확인되었다.
  • Midjourney는 특히 외부 및 내부 개념 예술의 경우 고품질이고 스타일이 일관된 아키텍처 렌더링을 생성하는 데 뛰어나지만, 정확한 의미론적 레이아웃 표현에는 어려움을 겪는다.
  • DALL-E 2는 '시계 기둥'이나 '반원형 창문'과 같은 복잡한 아키텍처 용어에서 텍스트 프롬프트와 이미지 출력 간 뛰어난 일치도를 보이며, 일부 경우 공간 관계를 잘못 해석하기도 한다.
  • StableDiffusion는 인페인팅 및 아웃페인팅을 통한 반복적 보완에 가장 큰 유연성을 제공하여, 기존 아키텍처 개념을 수정하거나 확장하는 데 이상적이다.
  • 공통적인 실패 케이스로는 바닥도면의 오해(예: 선을 의미론적 실체가 아닌 스타일적 요소로 오인), 객체 수의 잘못된 계산(예: 다섯 개의 건물), 공간 배치의 일관성 없는 표현 등이 있다.
  • 본 연구는 현재 AI 모델이 시각적 아이디어 도출을 크게 가속화할 수는 있지만, 문을 방과 연결하는 것과 같은 의미론적 아키텍처 의미나 구조적 논리 등에 대한 이해가 부족하다는 점을 확인하였다. 이는未래의 BIM 데이터 기반 훈련이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.