Skip to main content
QUICK REVIEW

[논문 리뷰] An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion

Rinon Gal, Yuval Alaluf|arXiv (Cornell University)|2022. 08. 02.
Multimodal Machine Learning Applications인용 수 464
한 줄 요약

논문은 Textual Inversion을 도입하며, 3–5 images에서 frozen 텍스트-투-이미지 모델의 임베딩 공간에 새로운 의사 단어(pseudo-word)를 학습하여 미세 조정 없이도 개인화된, 언어 가이드 생성과 사용자가 제공한 개념의 구성 표현을 가능하게 한다.

ABSTRACT

Text-to-image models offer unprecedented freedom to guide creation through natural language. Yet, it is unclear how such freedom can be exercised to generate images of specific unique concepts, modify their appearance, or compose them in new roles and novel scenes. In other words, we ask: how can we use language-guided models to turn our cat into a painting, or imagine a new product based on our favorite toy? Here we present a simple approach that allows such creative freedom. Using only 3-5 images of a user-provided concept, like an object or a style, we learn to represent it through new "words" in the embedding space of a frozen text-to-image model. These "words" can be composed into natural language sentences, guiding personalized creation in an intuitive way. Notably, we find evidence that a single word embedding is sufficient for capturing unique and varied concepts. We compare our approach to a wide range of baselines, and demonstrate that it can more faithfully portray the concepts across a range of applications and tasks. Our code, data and new words will be available at: https://textual-inversion.github.io

연구 동기 및 목표

  • 사용자가 제공한 개념을 위해 고정된 모델을 사용하여 개인화된 텍스트-투-이미지 생성을 가능하게 한다.
  • 텍스트 인코더의 임베딩을 대체하는 학습 가능한 임베딩 v*로 새로운 개념 S*를 표현한다.
  • 모델의 priors를 보존하면서도 미세한 시각적 재구성 및 편집을 가능하게 한다.
  • GAN- inversion에서 영감을 얻은 확장으로 임베딩 공간을 탐색하고 작업 간 충실도를 평가한다.
  • 객체 변형, 스타일 전이, 구성 및 바이어스 감소 등에서의 응용을 보여준다.

제안 방법

  • 고정된 텍스트 인코더와 확산 디노이저를 갖춘 latent diffusion models (LDMs)에서 작동한다.
  • 새로운 개념 S*를 텍스트 인코더의 자리 토큰 임베딩을 대체하는 학습 가능한 임베딩 v*로 표현한다.
  • 'A photo of S*'와 같은 프롬프트로 라벨링된 소수의 예시 이미지들의 LDM 손실을 최소화하는 재구성objective를 사용해 v*를 최적화한다.
  • v*를 최적화하는 동안 cθ(텍스트 인코더)와 εθ(디노이저)를 고정한다.
  • 최적화 도중 생성을 안내하기 위해 CLIP-ImageNet 템플릿에서 뽑은 중립적 맥락 프롬프트를 사용한다.
  • LDM 기본값에 근접한 하이퍼파라미터(예: 5,000 최적화 단계)로 실험하고 정성적, 정량적 분석을 보고한다.

실험 결과

연구 질문

  • RQ1단일의 새로운 임베딩(의사 단어)이 다양한 맥락에서 사용자 제공 개념을 높은 충실도로 포착할 수 있는가?
  • RQ2임베딩 기반 개인화가 충실도와 편집 가능성 면에서 자막 기반 또는 이미지 프롬프 기반의 baselines와 비교해 어떻게 다른가?
  • RQ3확장 임베딩 공간, 점진적 또는 이미지별 토큰, 규제가 재구성 품질과 일반화에 어떤 역할을 하는가?
  • RQ4학습된 의사 단어를 재학습 없이 스타일 전이, 다중 개념의 구성, 바이어스 감소에 사용할 수 있는가?
  • RQ5복합 관계 프롬프트에서 여러 의사 단어를 구성하는 한계는 무엇인가?

주요 결과

  • 단일 의사 단어 임베딩은 고유한 개념을 포착하고 프롬프트에서 다양한 구성을 지원한다.
  • 의사 단어는 자막 기반이나 판별 기반 baselines보다 대상 개념에 대한 시각적 충실도를 높게 달성한다.
  • GAN inversion에서 영감을 얻은 확장(다중 단어, 점진적 업데이트, 규제)은 기본 텍스트 인버전에 비해 뚜렷한 이득을 제공하지 않는 경우가 많다.
  • 임베딩은 스타일 전이, 여러 개념의 구성, 작은 선별 데이터셋으로 바이어스 감소에 사용될 수 있다.
  • 학습된 의사 단어는 Blended Latent Diffusion 같은 다운스트림 모델과 통합되어 국지적 편집에 활용될 수 있다.
  • 본 접근은 이미지 다양성, 텍스트 지시 합성, 추상적 개념 표현(예: 스타일) 등을 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.