Skip to main content
QUICK REVIEW

[논문 리뷰] DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter

Ziyi Dong, Pengxu Wei|arXiv (Cornell University)|2022. 11. 21.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

DreamArtist++는 단일 기준 이미지를 사용하는 일방적 텍스트-이미지 생성을 위한 양음성 프롬프트 튜닝 방법을 제안한다. 이 방법은 특징 보존과 생성 다양성을 균형 있게 유지하기 위해 쌍체의 양성 및 음성 임bedding을 사용한다. 이는 기존의 Textual Inversion 및 DreamBooth와 비교해도 정량적 평가 및 인간 평가에서 이미지 품질, 다양성, 제어 가능성 측면에서 최고 성능을 기록한다.

ABSTRACT

State-of-the-arts text-to-image generation models such as Imagen and Stable Diffusion Model have succeed remarkable progresses in synthesizing high-quality, feature-rich images with high resolution guided by human text prompts. Since certain characteristics of image content \emph{e.g.}, very specific object entities or styles, are very hard to be accurately described by text, some example-based image generation approaches have been proposed, \emph{i.e.} generating new concepts based on absorbing the salient features of a few input references. Despite of acknowledged successes, these methods have struggled on accurately capturing the reference examples' characteristics while keeping diverse and high-quality image generation, particularly in the one-shot scenario (\emph{i.e.} given only one reference). To tackle this problem, we propose a simple yet effective framework, namely DreamArtist, which adopts a novel positive-negative prompt-tuning learning strategy on the pre-trained diffusion model, and it has shown to well handle the trade-off between the accurate controllability and fidelity of image generation with only one reference example. Specifically, our proposed framework incorporates both positive and negative embeddings or adapters and optimizes them in a joint manner. The positive part aggressively captures the salient characteristics of the reference image to drive diversified generation and the negative part rectifies inadequacies from the positive part. We have conducted extensive experiments and evaluated the proposed method from image similarity (fidelity) and diversity, generation controllability, and style cloning. And our DreamArtist has achieved a superior generation performance over existing methods. Besides, our additional evaluation on extended tasks, including concept compositions and prompt-guided image editing, demonstrates its effectiveness for more applications.

연구 동기 및 목표

  • 단일 기준 이미지만을 사용할 경우 과적합 및 낮은 제어 가능성 문제를 겪는 기존 일방적 텍스트-이미지 생성 방법의 한계를 해결하기 위해.
  • 희망적인 시각적 특징과 바람직하지 않은 특징을 모두 포착하는 双임bedding 학습 전략을 도입함으로써 생성 다양성과 정확성을 향상시키기 위해.
  • 스타일 전이, 객체 조합, 프롬프트 유도 편집과 같은 복잡한 설명을 포함한 고품질의 제어 가능한 이미지 생성을 가능하게 하기 위해.
  • 강력한 텍스트 프롬프트 및 기준 콘텐츠와의 일치를 유지하면서도 다수의 기준 이미지에 의존하는 것을 줄이기 위해.
  • 기존 디퓨전 모델과 호환되며, 더 넓은 배포를 가능하게 하는 파rameter 효율적인 방법을 개발하기 위해.

제안 방법

  • DreamArtist++는 양음성 프롬프트 튜닝(PNPT) 전략을 사용하여, 기준 이미지에서 주요 특징을 포착하는 양성 임베딩($S^{p}_{*}$)과 결함을 교정하고 잘못된 특징을 피하는 데 도움을 주는 음성 임베딩($S^{n}_{*}$)을 함께 학습한다.
  • 디퓨전 모델의 전체 파라미터를 미세조정하지 않고, 텍스트 인코더와 U-Net 내 프롬프트 임베딩만을 미세조정함으로써 효율성과 일반화 능력을 유지한다.
  • 양성 임베딩은 핵심 시각적 특성에 초점을 맞춰 다양한 생성을 이끈다. 반면 음성 임베딩은 양성 신호에서 유래한 오류를 내省하고 수정함으로써 정확도를 향상시킨다.
  • 추론 중에 분류기 자유 가이던스를 사용하여, 학습된 가짜 단어와 새로운 묘사가 조합된 텍스트 프롬프트를 통해 영향력 있는 제어를 가능하게 한다.
  • 다양한 학습된 가짜 단어를 조합함으로써 개념 조합과 프롬프트 유도 편집을 지원하며, 각 가짜 단어는 자체의 양성 및 음성 임베딩을 가진다.
  • LDM과 같은 사전 훈련된 디퓨전 모델과 호환되며, 아키텍처 수정 없이도 표준 텍스트-이미지 생성 파이프라인 내에서 작동한다.

실험 결과

연구 질문

  • RQ1단일 기준 이미지 기반의 텍스트-이미지 생성 방법이 과적합 없이도 높은 다양성과 제어 가능성을 달성할 수 있는가?
  • RQ2이중 임베딩(양성-음성) 프롬프트 튜닝 전략은 단일 임베딩 방법에 비해 생성 품질을 어떻게 향상시키는가?
  • RQ3학습된 가짜 단어가 복잡한 텍스트 유도 이미지 생성, 특히 조합 및 편집 작업을 얼마나 잘 지원할 수 있는가?
  • RQ4생성된 이미지는 실제 이미지와 비교해 얼마나 현실감이 있으며, 인간 터닝 테스트를 통과할 수 있는가?
  • RQ5메서드는 기준 이미지와 프롬프트 간의 충돌하는 묘사나 도메인 이동 상황에서도 일반화 능력을 유지할 수 있는가?

주요 결과

  • DreamArtist++는 인간 터닝 테스트에서 34.5%의 실패율을 기록하여 30% 기준을 크게 초월했으며, 이는 생성된 이미지가 매우 현실적이며 실제 이미지와 구별하기 어려운 정도임을 시사한다.
  • 인간 평가에서 83.13%의 참가자가 Textual Inversion에 비해 DreamArtist가 생성한 애니메이션 이미지를 선호했으며, 이는 예술 분야에서 뛰어난 시각적 품질을 보여준다.
  • 다양한 벤치마크에서, 특히 제로샷 및 피샷 설정에서 이미지 유사도, 다양성, 제어 가능성 측면에서 기존 방법을 모두 압도했다.
  • DreamArtist++는 복잡한 프롬프트 조건에서도 다양한 이미지를 성공적으로 생성했으며, 기준 이미지와 충돌하는 조건이라도 로봇 몸체에 고대 회화 스타일을 결합하는 등 효과적으로 작동했다.
  • 프롬프트 기반 이미지 편집도 효과적으로 수행했으며, 생성된 부분이 원본 맥락에 자연스럽게 통합되어 원래 LDM 기능 수준의 성능을 달성했다.
  • 모델는 다수의 학습된 가짜 단어를 조합해 개념 조합 능력을 유감없이 발휘했으며, 객체-스타일 및 스타일-스타일 조합 등에서도 일관된 이미지를 생성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.