Skip to main content
QUICK REVIEW

[논문 리뷰] Creative Painting with Latent Diffusion Models

Xianchao Wu|arXiv (Cornell University)|2022. 09. 29.
Generative Adversarial Networks and Image Synthesis인용 수 9
한 줄 요약

이 논문은 잠재 확산 모델(LDM)의 창의적 그림 그리기 능력을 향상시키기 위해 위키백과에서 얻은 풍부한 맥락적 정보로 사용자 텍스트 프롬프트를 확장하고, 81,444幅의 예술 작품을 포함한 WikiArt 데이터셋으로 미세조정함으로써, 복잡한 현대 주제에 대해 다양하고 예술가 스타일의 그림을 조건부로 생성할 수 있도록 한다. 이 방법은 기준 모델 대비 예술적 표현력과 창의성을 크게 향상시킨다.

ABSTRACT

Artistic painting has achieved significant progress during recent years. Using an autoencoder to connect the original images with compressed latent spaces and a cross attention enhanced U-Net as the backbone of diffusion, latent diffusion models (LDMs) have achieved stable and high fertility image generation. In this paper, we focus on enhancing the creative painting ability of current LDMs in two directions, textual condition extension and model retraining with Wikiart dataset. Through textual condition extension, users' input prompts are expanded with rich contextual knowledge for deeper understanding and explaining the prompts. Wikiart dataset contains 80K famous artworks drawn during recent 400 years by more than 1,000 famous artists in rich styles and genres. Through the retraining, we are able to ask these artists to draw novel and creative painting on modern topics. Direct comparisons with the original model show that the creativity and artistry are enriched.

연구 동기 및 목표

  • 잠재 확산 모델(LDM)에서 텍스트-이미지 생성의 창의성과 예술적 품질을 향상시키는 것.
  • 예를 들어 '중국의 도시화' 또는 '아시아의 아침'와 같은 추상적 또는 고수준의 텍스트 프롬프트에 대해 표현력 있고 스토리가 담긴 그림을 생성하는 데 도전하는 것.
  • 특정 예술가(예: 반 고흐, 모네 등)를 명시적으로 초대하여 그들의 고유한 스타일로 예술 작품을 생성할 수 있도록 조건부 이미지 생성을 가능하게 하는 것.
  • 대규모로 촬영된 예술 데이터셋을 활용해 LDM을 재학습시켜 예술적 다양성과 정확도를 향상시킬 수 있는지 탐색하는 것.

제안 방법

  • 사용자가 제공한 텍스트 프롬프트를 위키백과와 대규모 언어 모델을 활용해 더 풍부하고 구체적이며 맥락 기반의 프롬프트로 확장한다.
  • 1,119명의 예술가가 참여한 27개 스타일과 45개 장르를 포함한 총 81,444幅의 예술 작품이 포함된 WikiArt 데이터셋으로 잠재 확산 모델을 재학습시킨다.
  • U-Net 기반 아키텍처의 크로스 어텐션 레이어에 예술가 정체성, 연도, 스타일, 장르를 추가적인 조건 신호로 통합한다.
  • 이미지를 저차원 잠재 공간으로 압축하기 위해 사전 훈련된 오토인코더를 사용하여, 효율적이고 고해상도의 잠재 공간에서의 확산를 가능하게 한다.
  • 확장된 텍스트 프롬프트와 예술가별 조건 신호에 의해 이끌리는 반전 확산 과정을 통해 이미지를 생성한다.
  • 오토인코더의 디코더를 사용하여 생성된 잠재 표현에서 고해상도 이미지를 재구성한다.

실험 결과

연구 질문

  • RQ1추상적 텍스트 프롬프트에 맥락적이고 서사적인 세부 정보를 추가로 제공함으로써 생성된 이미지의 예술적 품질과 창의성이 향상되는가?
  • RQ2WikiArt와 같은 대규모로 촬영된 예술 데이터셋으로 사전 훈련된 LDM을 미세조정하면, 다양하고 스타일적으로 정확한 그림 생성 능력이 얼마나 향상되는가?
  • RQ3예술가 정체성, 스타일, 장르에 대한 명시적 조건 부여가 다양한 프롬프트에 걸쳐 일관되고 인식 가능한 예술적 출력을 이끌 수 있는가?
  • RQ4확장된 프롬프트와 예술가별 조건 신호는 생성된 그림의 정서적 표현력과 주제적 깊이에 어떤 영향을 미치는가?

주요 결과

  • 고수준의 프롬프트, 예를 들어 '중국의 도시화'와 같은 경우, 텍스트 조건 확장으로 인해 이미지 품질과 표현력이 크게 향상되어 서사적 구성이 풍부한 그림을 생성할 수 있게 되었다.
  • WikiArt 데이터셋으로의 미세조정 덕분에, 반 고흐의 물결치는 하늘이나 모네의 인상파 수면 풍경 같은 유명 예술가의 독특한 스타일로 그림을 생성할 수 있게 되었다.
  • 동일한 프롬프트에 대해 여러 예술가의 다양한 예술적 해석을 성공적으로 생성하였으며, 각 예술가의 특징적인 시각적 언어를 유지하였다.
  • 예를 들어 '청해탄 고원의 기차'와 같은 프롬프트의 경우, 확장된 프롬프트로 인해 월광과 전통 배 같은 상징적 요소를 포함한 더 정서적으로 영향력 있고 세밀한 출력이 유도되었다.
  • 예술가별 조건 신호의 통합은 산업 응용 분야인 티셔츠 디자인 및 광고에 적합한 개인화되고 사용자 맞춤형 출력을 가능하게 하였다.
  • 시각적 비교 결과, 생성된 이미지가 사진처럼 현실적인 출력보다는 손으로 그린 그림에 더 가까운 강한 예술적 스타일 전이 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.