Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP-CLOP: CLIP-Guided Collage and Photomontage

Piotr Mirowski, Dylan Banarse|arXiv (Cornell University)|2022. 05. 06.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

CLIP-CLOP는 수동으로 촬영한 이미지 조각을 사용하여 고해상도 사진 몽타주를 구성하는 기울기 기반의 콜라주 생성기를 소개한다. CLIP의 이중 이미지-텍스트 인코더를 활용한 최적화를 통해 예술적 일관성을 유지하면서도 인간이 개입하는 방식으로 조각의 위치, 크기, 회전을 제어할 수 있다. 이는 프롬프트 전용 디퓨전 모델보다 더 높은 예술적 제어력을 제공한다.

ABSTRACT

The unabated mystique of large-scale neural networks, such as the CLIP dual image-and-text encoder, popularized automatically generated art. Increasingly more sophisticated generators enhanced the artworks' realism and visual appearance, and creative prompt engineering enabled stylistic expression. Guided by an artist-in-the-loop ideal, we design a gradient-based generator to produce collages. It requires the human artist to curate libraries of image patches and to describe (with prompts) the whole image composition, with the option to manually adjust the patches' positions during generation, thereby allowing humans to reclaim some control of the process and achieve greater creative freedom. We explore the aesthetic potentials of high-resolution collages, and provide an open-source Google Colab as an artistic tool.

연구 동기 및 목표

  • AI 보조 예술에서 인간의 주도성을 회복하는 창의적이고 상호작용 가능한 프로시저 콜라주 생성 시스템을 개발한다.
  • 예술가가 생성 과정 중 개별 이미지 조각을 셀렉션하고 조작할 수 있도록 하여 프롬프트 기반 엔지니어링을 초월한 창의적 제어를 가능하게 한다.
  • CLIP의 의미적 이해를 기반으로 선택된 조각에 대한 애핀 변환과 색상 변환을 미분 가능한 최적화로 형식화한다.
  • 잠재적 디퓨전이나 스트로크 기반 생성이 아닌, 조각 기반 조합을 통해 고해상도이고 시각적으로 매력적인 사진 몽타주를 탐색한다.
  • CLIP 기반의 조각 기반 이미지 합성에 적합한 예술적 실험을 지원하는 오픈소스 도구를 제공한다.

제안 방법

  • 콜라주 생성기는 N개의 수동으로 선택된 이미지 조각에 대해 미분 가능한 애핀 변환(이동, 회전, 스케일)과 색상 변환(명도, 대비, 채도)을 적용한다.
  • 조각들은 투명 또는 불투명 블렌딩 방식으로 캔버스 위에 겹쳐지며, 최종 이미지는 RGB 텐서로 렌더링된다.
  • CLIP 이중 인코더는 생성된 콜라주와 사용자가 제공한 텍스트 프롬프트 간의 일치도를 평가하여 최적화를 위한 손실 신호를 제공한다.
  • 최적화는 조각 파라미터(위치, 색상, 변환)에 대해 기울기 하강법을 사용하며, 고해상도 출력을 위해 겹치는 CLIP 크리틱을 사용한 계층적 정밀 조정이 이루어진다.
  • 사용자는 UI를 통해 생성 과정을 일시정지하여 조각의 위치, 회전, 크기를 수동으로 조정한 후 최적화를 재개할 수 있다—이는 인간이 개입하는 최적화를 가능하게 한다.
  • 시스템은 다양한 렌더링 전략과 크리틱 평가 방식을 지원하며, 고해상도 이미지 조합을 위한 겹치는 영역 점수 평가 방식도 포함한다.

실험 결과

연구 질문

  • RQ1CLIP 기반의 조각 기반 콜라주 생성기는 프롬프트 전용 디퓨전 모델보다 더 높은 예술적 제어력을 제공하면서도 고해상도이고 시각적으로 일관된 예술작품을 생성할 수 있는가?
  • RQ2최적화 과정 중 인간이 개입하는 방식이 생성된 콜라주의 미학적 품질과 창의적 표현력에 어떤 영향을 미치는가?
  • RQ3잠재적 디퓨전이나 스트로크 기반 생성에 의존하지 않고 CLIP의 의미적 이해가 복잡한 다중 조각 콜라주의 구성에 얼마나 효과적으로 기여할 수 있는가?
  • RQ4다양한 종류의 조각(예: 동물, 부서진 접시, 과일 등)은 최종 콜라주의 시각적 스타일과 현실감에 어떤 영향을 미치는가?
  • RQ5계층적이고 겹치는 CLIP 크리틱 평가 평가 방식은 대규모 사진 몽타주의 일관성과 해상도를 향상시키는 데 기여하는가?

주요 결과

  • CLIP-CLOP는 잠재 공간 최적화 없이도 수동으로 선택된 이미지 조각만을 사용하여 고해상도이고 사실적인 콜라주를 생성하며, 해석 가능성과 제어력이 완전히 보장된다.
  • 최적화 과정 중 조각 위치의 인간이 개입하는 편집은 상호작용 예시를 통해 창작 주도성과 구성 정밀도를 크게 향상시킴을 입증한다.
  • 적은 수의 조각(예: 10~20개)은 추상적이고 피카소 스타일의 콜라주를 생성하는 반면, 더 많은 조각(예: 100개 이상)은 물소나 무용수 콜라주처럼 점점 더 사실적이고 세밀한 이미지를 만들어낸다.
  • 동물이나 부서진 접시의 조각을 사용할 경우 독특한 시각적 질감을 만들어내며, '스테인드글라스 스타일의 앨런 튜링'과 같은 작품에서 스트로크 기반(CLIPDraw) 및 디퓨전 기반 방법보다 질감의 정확도가 뛰어나다.
  • 시스템은 계층적이고 겹치는 CLIP 크리틱 평가를 지원하여, 겹치는 영역을 평가하고 결과를 통합함으로써 고해상도 이미지 생성이 가능하다.
  • 오픈소스 Google Colab 구현은 예술가가 다양한 저작권 없는 이미지 조각을 사용하여 CLIP 기반 콜라주를 실험할 수 있도록 하며, 완전한 재현 가능성과 확장 가능성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.