Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Visual Prompt: Unifying Distributional Control of Pre-Trained Generative Models

Chen Wu, Saman Motamed|arXiv (Cornell University)|2022. 09. 14.
Generative Adversarial Networks and Image Synthesis인용 수 12
한 줄 요약

이 논문은 사전 훈련된 생성 모델에 대한 분포 제어를 위해 상용 모델을 제어 신호로 사용하는 새로운 프레임워크인 Generative Visual Prompt (PromptGen)를 소개한다. 제어를 역행 가능한 신경망을 통해 근사하는 에너지 기반 모델(EBM)로 모델링함으로써, 추론 시 최적화 없이도 효율적인 순방향 추론 샘플링이 가능해지며, 이는 StyleGAN2, 확산 오토에코더, NVAE와 같은 다양한 모델에서 CLIP, 분류기, 또는 역행렬 그래픽스 모델을 사용해 제어된, 편향이 제거된 생성을 가능하게 한다.

ABSTRACT

Generative models (e.g., GANs, diffusion models) learn the underlying data distribution in an unsupervised manner. However, many applications of interest require sampling from a particular region of the output space or sampling evenly over a range of characteristics. For efficient sampling in these scenarios, we propose Generative Visual Prompt (PromptGen), a framework for distributional control over pre-trained generative models by incorporating knowledge of other off-the-shelf models. PromptGen defines control as energy-based models (EBMs) and samples images in a feed-forward manner by approximating the EBM with invertible neural networks, avoiding optimization at inference. Our experiments demonstrate how PromptGen can efficiently sample from several unconditional generative models (e.g., StyleGAN2, StyleNeRF, diffusion autoencoder, NVAE) in a controlled or/and de-biased manner using various off-the-shelf models: (1) with the CLIP model as control, PromptGen can sample images guided by text, (2) with image classifiers as control, PromptGen can de-bias generative models across a set of attributes or attribute combinations, and (3) with inverse graphics models as control, PromptGen can sample images of the same identity in different poses. (4) Finally, PromptGen reveals that the CLIP model shows a "reporting bias" when used as control, and PromptGen can further de-bias this controlled distribution in an iterative manner. The code is available at https://github.com/ChenWu98/Generative-Visual-Prompt.

연구 동기 및 목표

  • GAN 및 확산 모델과 같은 비지도 사전 훈련된 생성 모델의 제어 불가능성과 편향 문제를 해결하기 위해.
  • 모델 특화 미세조정이나 레이블 데이터가 필요 없이 다양한 생성 모델 간의 분포 제어를 통합하기 위해.
  • 추론 시 최적화를 피함으로써 효율적인 순방향 추론 샘플링을 가능하게 하기 위해.
  • CLIP와 같은 사전 훈련된 제어 모델의 편향을 드러내고 제거하기 위해 반복적 제어 조합을 통해.
  • 훈련 후 생성 모델에서 제어를 분리하는 모듈형, 독립형 프레임워크를 제공하기 위해.

제안 방법

  • PromptGen은 CLIP, 분류기, 또는 역행렬 그래픽스 네트워크와 같은 상용 모델을 통해 정의된 에너지 기반 모델(EBM)로 제어를 설정한다.
  • 이 EBM는 역행렬 신경망(INN)을 사용해 근사되며, 반복 최적화 없이도 빠른 순방향 추론 샘플링이 가능해진다.
  • 사전 훈련된 생성 모델의 가중치는 고정되어 있어 재훈련이 필요 없게 된다.
  • 제어 신호는 생성 모델의 잠재 공간과 INN을 조합함으로써 적용되며, 이는 샘플링할 수 있는 새로운 미분 가능한 분포를 형성한다.
  • 반복적 제어는 조합된 모델을 새로운 생성 모델로 간주함으로써 가능해지며, 편향된 분포의 개선이 가능해진다.
  • 이 방법은 기반 생성 모델에 대해 무관하므로, StyleGAN2, StyleNeRF, 확산 오토에코더, NVAE를 모두 지원한다.

실험 결과

연구 질문

  • RQ1사용 가능한 상용 모델을 제어 신호로 사용하여 사전 훈련된 생성 모델에서 효율적이고 순방향 추론 샘플링을 달성할 수 있는가?
  • RQ2모델 특화 적응이 필요 없이 다양한 생성 모델(GAN, 확산 모델, VAE 등) 간의 제어를 통합할 수 있는가?
  • RQ3PromptGen은 사전 훈련된 분류기를 사용해 인종이나 성별과 같은 속성에 대해 생성 모델의 편향을 제거할 수 있는가?
  • RQ4CLIP의 내재된 편향(예: 보고 편향)이 제어된 생성에 나타나는가, 그리고 이를 제거할 수 있는가?
  • RQ5반복적 제어 조합은 생성 분포의 품질과 공정성 향상에 기여하는가?

주요 결과

  • PromptGen는 추론 시 최적화 없이도 CLIP, 분류기, 자세 회귀기와 같은 상용 모델을 사용해 사전 훈련된 생성 모델에서 효율적이고 순방향 추론 샘플링을 가능하게 한다.
  • CLIP을 제어 신호로 사용할 경우, '아기의 사진'과 같은 텍스트 프롬프트에 높은 정확도로 일치하는 이미지를 성공적으로 생성한다.
  • 인종 분류기를 기반으로 유도할 경우, PromptGen은 인종 그룹 간 균일한 샘플링을 달성하여, 기본적으로 백인을 선호하는 StyleGAN2의 편향을 효과적으로 제거한다.
  • 역행렬 그래픽스 모델을 사용해 자세가 변하는 동안에도 정체성을 유지하는 생성을 가능하게 한다.
  • 프레임워크는 CLIP가 '메이크업 없음'이라는 표현과 여성 간에 정확히 양의 상관관계를 보이는 '보고 편향(reporting bias)'을 드러내며, PromptGen은 이를 반복적으로 제거할 수 있다.
  • PromptGen와 CLIP 검색 간의 실패 유형이 일관되므로, 관찰된 실패(예: 부정 논리나 수치 계수를 잘못 해석)는 PromptGen의 방법보다 CLIP의 한계에서 기인함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.