Skip to main content
QUICK REVIEW

[논문 리뷰] StyleCLIPDraw: Coupling Content and Style in Text-to-Drawing Translation

Peter Schaldenbrand, Zhixuan Liu|arXiv (Cornell University)|2022. 02. 24.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

StyleCLIPDraw는 텍스트 프롬프트와 기준 스타일 이미지를 사용하여 콘텐츠와 스타일을 동시에 최적화하는 결합 최적화 프레임워크를 제안한다. CLIP 및 VGG16 특징을 활용한다. 인간 평가 결과, 순차적 스타일 전이 방식 대비 84.9%의 선호도를 보이며, 예술적 인식에서 스타일과 콘텐츠가 본질적으로 연결되어 있음을 보여주고, 공동 최적화가 더 선호되며 예술적으로 일관된 결과를 산출함을 시사한다.

ABSTRACT

Generating images that fit a given text description using machine learning has improved greatly with the release of technologies such as the CLIP image-text encoder model; however, current methods lack artistic control of the style of image to be generated. We present an approach for generating styled drawings for a given text description where a user can specify a desired drawing style using a sample image. Inspired by a theory in art that style and content are generally inseparable during the creative process, we propose a coupled approach, known here as StyleCLIPDraw, whereby the drawing is generated by optimizing for style and content simultaneously throughout the process as opposed to applying style transfer after creating content in a sequence. Based on human evaluation, the styles of images generated by StyleCLIPDraw are strongly preferred to those by the sequential approach. Although the quality of content generation degrades for certain styles, overall considering both content extit{and} style, StyleCLIPDraw is found far more preferred, indicating the importance of style, look, and feel of machine generated images to people as well as indicating that style is coupled in the drawing process itself. Our code (https://github.com/pschaldenbrand/StyleCLIPDraw), a demonstration (https://replicate.com/pschaldenbrand/style-clip-draw), and style evaluation data (https://www.kaggle.com/pittsburghskeet/drawings-with-style-evaluation-styleclipdraw) are publicly available.

연구 동기 및 목표

  • 텍스트 기반 이미지 생성에서 예술적 제어의 부족, 특히 단순 텍스트 기술을 초월한 스타일 커스터마이제이션의 부족을 해결하기 위해.
  • 예술 이론이 제안하는 바와 같이, 드로잉 과정에서 스타일과 콘텐츠가 본질적으로 연결되어 있는지 조사하기 위해.
  • 사용자가 텍스트를 통해 콘텐츠를 지정하고 예시 이미지를 통해 스타일을 지정할 수 있도록 하는 방법을 개발하기 위해.
  • 스타일과 콘텐츠 품질에 대한 세부 인간 평가가 포함된 352개의 AI 생성 드로잉으로 구성된 공개 데이터셋을 제공하기 위해.
  • 코드, Colab 노트북, 온라인 데모를 포함한 접근성 있는 도구를 제공하여 스타일 제어 가능한 이미지 생성에 대한 접근성을 확대하기 위해.

제안 방법

  • StyleCLIPDraw는 CLIP의 텍스트-이미지 임베딩 유사도를 사용한 콘텐츠 손실과, 기준 스타일 이미지에서 추출한 VGG16 특징을 사용한 스타일 손실을 최소화함으로써, 가분성 있는 드로잉 표현을 공동 최적화한다.
  • 이 방법은 백프로파게이션을 통해 반복적으로 최적화되는 래스터라이즈된 가분성 드로잉 표현을 사용하여 텍스트 및 스타일 이미지 임베딩과 일치하도록 한다.
  • 콘텐츠 손실은 CLIP의 텍스트-이미지 대비 손실을 통해 계산되며, 생성된 드로잉이 프롬프트의 의미적 콘텐츠와 일치함을 보장한다.
  • 스타일 손실은 사전 훈련된 VGG16 네트워크의 특징 맵의 그램 행렬을 사용하여 계산되며, 스타일 이미지의 텍스처, 색상, 공간적 레이아웃을 캡처한다.
  • 최적화 과정은 엔드 투 엔드로 이루어져, 스타일과 콘텐츠가 생성 과정 전반에 걸쳐 상호 적응하도록 보장하며, 후행적으로 스타일 전이를 적용하는 것과는 다릅니다.
  • 이 접근법은 139명의 참가자가 참여한 인간 연구를 통해 평가되었으며, CLIPDraw를 먼저 적용한 후 별도의 스타일 전이를 수행하는 기준 방법과 비교되었다.

실험 결과

연구 질문

  • RQ1텍스트-드로잉 생성에서 콘텐츠와 스타일을 공동 최적화하면 순차적 콘텐츠 생성 및 스타일 전이 방식에 비해 더 선호되며 예술적으로 일관된 결과를 얻을 수 있는가?
  • RQ2강한 또는 추상적인 스타일을 적용할 경우 생성된 콘텐츠의 인식 품질은 어느 정도 저하되며, 이는 전체 사용자 선호도에 어떤 영향을 미치는가?
  • RQ3사용자는 AI 생성 드로잉에서 스타일과 콘텐츠의 상호의존성을 어떻게 인식하는가? 이는 스타일과 콘텐츠가 분리될 수 없다는 예술 이론과 일치하는가?
  • RQ4기준 이미지가 비전문가 사용자에게 텍스트-드로잉 생성에서 효과적이고 직관적인 스타일 제어 수단이 될 수 있는가?
  • RQ5스타일의 모호성(예: 추상 대 비현실적)은 생성된 콘텐츠의 인식 가능성과 선호도에 어떤 영향을 미치는가?

주요 결과

  • 스타일과 콘텐츠를 모두 고려할 때 인간 평가에서 StyleCLIPDraw는 84.9%의 선호도를 보이며, 분리된 기준 방법 대비 강력한 선호도를 보이며 결합 방법의 우수성을 시사한다.
  • 일부 경우에서 콘텐츠 명료도가 낮아지더라도, 스타일과 콘텐츠의 공동 최적화가 전체적으로 훨씬 높은 선호도를 이끌어내었으며, 사용자 인식에서 스타일의 중요성을 강조한다.
  • 스타일 이미지의 현실성에 대한 모호성과 인식된 콘텐츠 품질 저하 사이에 강한 정적 상관관계(r = 0.72, p = 0.04)를 발견하여, 추상 스타일이 콘텐츠 인식을 어렵게 할 수 있음을 시사한다.
  • 인간 평가에서 모든 스타일 차원에서 기준 방법 대비 성능이 뛰어나, 스타일이 후행 처리가 아니라 예술적 인식의 핵심 요소임을 확인한다.
  • 352개의 AI 생성 드로잉으로 구성된 새로운 공개 데이터셋을 제공하였으며, 스타일과 콘텐츠 품질에 대한 세부 인간 주석이 포함되어 있어 향후 자동 스타일 평가 연구에 기여한다.
  • 코드, Google Colab 노트북, 온라인 데모를 포함하여 접근 가능한 도구를 공개하여 비기술자 사용자 및 향후 연구에 넓은 접근성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.