Skip to main content
QUICK REVIEW

[논문 리뷰] Multiresolution Textual Inversion

Giannis Daras, Alexandros G. Dimakis|arXiv (Cornell University)|2022. 11. 30.
Natural Language Processing Techniques인용 수 7
한 줄 요약

이 논문은 다중 해상도 텍스트 역행을 소개한다. 이는 확산 시간에 조건을 두어 동일한 개념을 다양한 수준의 세부 정보로 표현하는 여러 가짜 단어를 학습하는 방법으로, 기존의 텍스트 역행을 확장한 것이다. 이를 통해 언어를 통한 제어 가능한 이미지 생성이 가능해지며, 사용자는 'A photo of $S^{*}(0.8)$'와 같이 낮은 세부 정보를 위한 프롬프트와 '$S^{*}(0.0)$'와 같이 높은 세부 정보를 위한 프롬프트를 사용하여 동일한 개념의 다양한 해상도의 이미지를 생성할 수 있다.

ABSTRACT

We extend Textual Inversion to learn pseudo-words that represent a concept at different resolutions. This allows us to generate images that use the concept with different levels of detail and also to manipulate different resolutions using language. Once learned, the user can generate images at different levels of agreement to the original concept; "A photo of $S^*(0)$" produces the exact object while the prompt "A photo of $S^*(0.8)$" only matches the rough outlines and colors. Our framework allows us to generate images that use different resolutions of an image (e.g. details, textures, styles) as separate pseudo-words that can be composed in various ways. We open-soure our code in the following URL: https://github.com/giannisdaras/multires_textual_inversion

연구 동기 및 목표

  • 다양한 해상도에서 개념을 표현하는 여러 가짜 단어를 학습하기 위해 텍스트 역행을 확장한다.
  • 사용자가 자연어 프롬프트를 통해 생성된 이미지의 세부 수준을 제어할 수 있도록 한다.
  • 기존 표준 텍스트 역행에서 사용하는 고정 임bedding과 이미지 생성 해상도를 분리한다.
  • 창의적 이미지 합성에서 다양한 개념 간에 서로 다른 해상도 구성 요소를 자유롭게 조합할 수 있도록 지원한다.
  • 사전 훈련된 텍스트-이미지 확산 모델 및 기존 방법(예: DreamBooth)과의 호환성을 유지한다.

제안 방법

  • 확산 시간 $t$ 에 따라 텍스트 임베딩을 조건화하여, $\mathrm{emb}_{\lfloor t/T \rfloor}$ 를 사용해 입력 개념의 다양한 해상도 수준을 표현한다.
  • 확산 단계에 따라 달라지는 노이즈 제거 목표를 통해 $\mathrm{Emb}^{*} = \{\mathrm{emb}_0, \dots, \mathrm{emb}_{T-1}\}$ 의 임베딩 집합을 최적화한다.
  • 고정 해상도, 반 해상도 의존, 완전 해상도 의존의 세 가지 샘플링 전략을 사용하여 생성 중 해상도 적용 방식을 제어한다.
  • 선형 보간을 통해 학습된 임베딩 간의 보간을 가능하게 하여 연속적인 해상도 제어를 실현한다.
  • 조건부 네트워크를 $c_\theta(y) = \mathrm{enc}_\theta(\mathrm{emb}_\theta(y))$ 로 분해하며, 임베딩 레이어를 시간 기반 해상도 인덱싱을 지원하도록 수정한다.
  • 표준 확산 목표를 사용하여 훈련한다: $\min_{\mathrm{emb}} \mathbb{E}_{t,x,z_t} \left|\left| \hat{\epsilon}_\theta(z_t(x), t, \mathrm{enc}_\theta(\mathrm{emb}_{\lfloor t/T \rfloor})) - \epsilon(z_0, z_t) \right|\right|^2$.

실험 결과

연구 질문

  • RQ1한 개념에 대해 다양한 세부 수준을 표현하는 여러 가짜 단어를 학습할 수 있는가?
  • RQ2다른 해상도 전용 임베딩을 선택함으로써 언어 프롬프트가 생성된 이미지의 해상도를 제어할 수 있는가?
  • RQ3제안된 방법이 다양한 해상도 수준 간에 높은 이미지 품질과 의미 일관성을 유지하는가?
  • RQ4학습된 해상도 전용 임베딩이 서로 다른 개념과 프롬프트 간에 조합될 수 있는가?
  • RQ5표준 텍스트 역행에 비해 다중 해상도 텍스트 역행의 생성 품질과 유연성 측면에서 어떻게 비교되는가?

주요 결과

  • 이 방법은 단일 개념에 대해 다양한 해상도 전용 임베딩을 성공적으로 학습하여 언어를 통한 이미지 세부 정보 제어를 가능하게 했다.
  • 고정 해상도 샘플링은 입력 이미지의 세부 정보(예: 단추)를 선택적으로 추출할 수 있게 하며, $S^{*}|0.0|$ 을 사용한다.
  • 반 해상도 의존 샘플링은 고노이즈 수준에서 고수준의 변형을 가능하게 하며, 예를 들어 $S^{*}(0.8)$ 은 입력의 색상과 자세를 약간만 반영하는 사실적인 사진을 생성한다.
  • 완전 해상도 의존 샘플링은 모든 확산 단계에서 입력 개념과 강한 일치를 유지하여 구조적 일관성을 보존한다.
  • 이 방법은 다양한 개념 간에 해상도 구성 요소를 임의로 조합할 수 있으며, 예를 들어 플라스틱 물체의 세부 구조를 활용해 새로운 형태의 개나 고양이를 생성할 수 있다.
  • qualitative 비교를 통해 다중 해상도 텍스트 역행이 개인화된 이미지 생성 작업에서 표준 텍스트 역행과 동등하거나 더 나은 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.