Skip to main content
QUICK REVIEW

[논문 리뷰] StyleAdapter: A Unified Stylized Image Generation Model

Zhouxia Wang, Xintao Wang|arXiv (Cornell University)|2023. 09. 04.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

StyleAdapter는 LoRA를 사용하지 않고 단일 패assing 모델로, 텍스트 프롬프트와 스타일 참조 이미지를 조합하여 높은 품질의 콘텐츠 충실도를 갖춘 세밀한 스타일 전이를 구현하는 모델을 제안한다. 이는 이중 경로 교차 어텐션 모듈과 세 가지 분리 전략을 사용하여 프롬프트 제어력을 향상시키고 참조 이미지 내 의미-스타일의 얽힘을 줄이며, 스타일 별 미세조정 없이도 경쟁적인 성능을 달성한다.

ABSTRACT

This work focuses on generating high-quality images with specific style of reference images and content of provided textual descriptions. Current leading algorithms, i.e., DreamBooth and LoRA, require fine-tuning for each style, leading to time-consuming and computationally expensive processes. In this work, we propose StyleAdapter, a unified stylized image generation model capable of producing a variety of stylized images that match both the content of a given prompt and the style of reference images, without the need for per-style fine-tuning. It introduces a two-path cross-attention (TPCA) module to separately process style information and textual prompt, which cooperate with a semantic suppressing vision model (SSVM) to suppress the semantic content of style images. In this way, it can ensure that the prompt maintains control over the content of the generated images, while also mitigating the negative impact of semantic information in style references. This results in the content of the generated image adhering to the prompt, and its style aligning with the style references. Besides, our StyleAdapter can be integrated with existing controllable synthesis methods, such as T2I-adapter and ControlNet, to attain a more controllable and stable generation process. Extensive experiments demonstrate the superiority of our method over previous works.

연구 동기 및 목표

  • 스タイ르 별 미세조정 없이도 통합된 LoRA 없는 모델을 개발하여 스타일화된 이미지 생성을 수행하는 것.
  • 텍스트 프롬프트와 시각적 스타일 참조를 융합할 때 프롬프트 제어력이 저하되는 문제를 해결하는 것.
  • 참조 이미지 내 의미와 스타일 특징 간의 강한 결합을 완화하여 콘텐츠 충실도를 향상시키는 것.
  • 재학습 없이도 새로운 스타일에 일반화 가능한 단일 패assing 생성을 가능하게 하는 것.
  • ControlNet과 T2I-Adapter와 같은 기존 제어 가능한 생성 방법과 통합하여 안정성과 제어력을 향상시키는 것.

제안 방법

  • 텍스트 프롬프트와 스타일 참조 특징을 별도로 처리한 후 융합하는 이중 경로 교차 어텐션 모듈(TPCA)을 도입한다.
  • 스타일 참조 이미지의 패치 단위 셔플링을 통해 의미-스타일 상관관계를 깨뜨리고 특징의 얽힘을 감소시킨다.
  • 특징 추출 과정에서 CLIP 클래스 임베딩을 제거하여 의미 콘텐츠와 스타일 표현을 분리한다.
  • 동일한 스타일을 공유하는 다양한 의미적 객체를 참조로 사용하여 스타일 일반화를 향상시키고 의미 편향을 줄인다.
  • TPCA와 분리 전략을 통합하여 단일 패assing 생성을 위한 유일한 추론 파이프라인을 구성한다.
  • T2I-Adapter와 ControlNet과 같은 제어 가능한 생성 방법과의 통합을 지원하여 제어력을 강화한다.

실험 결과

연구 질문

  • RQ1스틸 별 미세조정 없이도 단일 통합 모델이 다양한 스타일에서 고 품질의 스타일화된 이미지를 생성할 수 있는가?
  • RQ2텍스트 프롬프트와 시각적 스타일 참조를 융합할 때 프롬프트 제어력을 어떻게 유지할 수 있는가?
  • RQ3참조 이미지 내 의미와 스타일 특징를 얼마나 효과적으로 분리할 수 있는가? 이는 콘텐츠 충실도 향상에 어떤 영향을 미치는가?
  • RQ4모델은 재학습 없이도 새로운 스타일에 일반화되면서도 높은 스타일 전이 품질과 의미 정확도를 유지할 수 있는가?
  • RQ5LoRA 기반 및 텍스트 인version 기반 접근법과 비교해 성능 및 효율성 측면에서 제안된 방법은 어떤가?

주요 결과

  • StyleAdapter는 최신 기술 대비 텍스트 유사도, 스타일 유사도, 이미지 품질 간의 균형을 더 잘 달성하며, 벤치마크에서 FID 137.40과 Style-Sim 0.3976을 기록한다.
  • 절단 실험을 통해 TPCA와 분리 전략이 필수적임을 확인: 어떤 구성 요소라도 제거할 경우 콘텐츠 충실도 또는 스타일 정확도가 저하된다.
  • 다양한 참조와 셔플링을 통해 모델은 프롬프트의 콘텐츠(예: 배럴 안에 있는 강아지)를 성공적으로 생성하면서도 참조의 질감과 브러시스트로크 세부 정보를 유지한다.
  • 참조에 다양한 의미적 요소가 포함되어 있을 경우, TI 기반 및 LoRA 기반 방법보다 사용자 선호도와 콘텐츠 충실도에서 뛰어난 성능을 보인다.
  • 테스트 시점 적응 없이도 새로운 스타일에 대해 높은 성능을 유지하며, 훈련 없이도 강력한 일반화 능력을 입증한다.
  • LoRA 없이도 경쟁적인 성능를 달성하지만, 세밀한 스타일 전이 품질에서는 여전히 LoRA에 약간 뒤지지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.