Skip to main content
QUICK REVIEW

[논문 리뷰] UPainting: Unified Text-to-Image Diffusion Generation with Cross-modal Guidance

Wei Li, Xue Xu|arXiv (Cornell University)|2022. 10. 28.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

UPainting은 사전 훈련된 트랜스포머 언어 모델을 활용해 텍스트 이해 능력을 향상시키고, 사전 훈련된 이미지-텍스트 매칭 모델에서 유도하는 교차 모odal 가이던스를 통합함으로써 생성 정확도와 텍스트-이미지 일치도를 향상시키는 통합 텍스트-이미지 확산 모델을 제안한다. 이 방법은 단순한 장면과 복잡한 장면 생성 모두에서 최신 기술 수준(SOTA)의 성능을 달성하여, 스테이블 디퓨전과 디스코 디퓨전과 같은 모델들보다 이미지-텍스트 일치도와 정확도에서 뛰어난 성능을 보인다.

ABSTRACT

Diffusion generative models have recently greatly improved the power of text-conditioned image generation. Existing image generation models mainly include text conditional diffusion model and cross-modal guided diffusion model, which are good at small scene image generation and complex scene image generation respectively. In this work, we propose a simple yet effective approach, namely UPainting, to unify simple and complex scene image generation, as shown in Figure 1. Based on architecture improvements and diverse guidance schedules, UPainting effectively integrates cross-modal guidance from a pretrained image-text matching model into a text conditional diffusion model that utilizes a pretrained Transformer language model as the text encoder. Our key findings is that combining the power of large-scale Transformer language model in understanding language and image-text matching model in capturing cross-modal semantics and style, is effective to improve sample fidelity and image-text alignment of image generation. In this way, UPainting has a more general image generation capability, which can generate images of both simple and complex scenes more effectively. To comprehensively compare text-to-image models, we further create a more general benchmark, UniBench, with well-written Chinese and English prompts in both simple and complex scenes. We compare UPainting with recent models and find that UPainting greatly outperforms other models in terms of caption similarity and image fidelity in both simple and complex scenes. UPainting project page \url{https://upainting.github.io/}.

연구 동기 및 목표

  • 기존에 별도의 모델로 다뤄지던 단순한 장면과 복잡한 장면의 텍스트-이미지 생성을 통합하는 것.
  • 사전 훈련된 이미지-텍스트 매칭 모델에서 유도하는 교차 모달 의미론과 스타일을 통합함으로써 이미지 생성 품질을 향상시키는 것.
  • 일반적인 텍스트 인코더가 추상적, 예술적, 복잡한 프롬프트 기술을 포착하는 데에 한계가 있음을 해결하는 것.
  • 다양한 프롬프트에 걸쳐 일반적인 텍스트-이미지 생성을 평가하기 위한 종합적인 벤치마크를 구축하는 것.
  • 대규모 언어 모델과 교차 모달 매칭 모델을 조합함으로써 생성 능력이 크게 향상됨을 입증하는 것.

제안 방법

  • UPainting은 자연어 프롬프트를 의미적 표현으로 매핑하기 위해 사전 훈련된 트랜스포머 언어 모델을 텍스트 인코더로 사용한다.
  • 이 모델은 확산 과정 중에 기울기 기반 최적화를 통해 사전 훈련된 이미지-텍스트 매칭 모델(예: CLIP)에서 유도하는 교차 모달 가이던스를 통합한다.
  • 노이즈 제거 과정에서 텍스트 의미론과 이미지-텍스트 일치도를 균형 있게 유지하기 위해 다양한 가이던스 스케줄을 적용한다.
  • 텍스트 조건부 확산 프레임워크에 교차 모달 가이던스를 효과적으로 통합하기 위해 아키텍처 개선을 도입한다.
  • 확산 모델은 텍스트 임베딩과 교차 모달 가이던스 신호 양쪽에 조건을 부여하여 의미론적 정확도와 시각적 정확도를 함께 최적화한다.
  • 새로운 훈련 전략을 통해 개선된 일치도와 세부 사항을 갖춘 종단 간 통합 생성 파이프라인을 학습할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1통합 확산 모델이 높은 정확도와 일치도로 단순한 장면과 복잡한 장면 이미지를 효과적으로 생성할 수 있는가?
  • RQ2대규모 언어 모델과 교차 모달 매칭 모델을 조합하면 텍스트-이미지 생성에 어떤 영향을 미치는가?
  • RQ3교차 모달 가이던스는 복잡한 장면 생성에서 이미지 품질과 프롬프트 준수도에 어떤 영향을 미치는가?
  • RQ4단일 모델이 단순 장면과 복잡한 장면 전용 모델을 모두 능가할 수 있는가?
  • RQ5기존의 벤치마크인 COCO와 DrawBench와 비교해 본다면, 제안된 방법은 일반화 능력과 견고성에서 어떻게 다른가?

주요 결과

  • UPainting은 COCO 데이터셋에서 프레셰 이너스티션 디스턴스(FID) 점수 8.34를 기록하여 스테이블 디퓨전(14.24)을 크게 앞서며 성능을 뛰어나게 한다.
  • 인간 평가 결과, 특히 복잡한 장면 프롬프트에서 UPainting이 스테이블 디퓨전보다 이미지-텍스트 일치도와 이미지 정확도에서 더 높은 선호도를 보였다.
  • 새로운 UniBench 벤치마크에서 검증된 결과, UPainting은 단순 장면과 복잡한 장면 생성 모두에서 뛰어난 성능을 보였다.
  • 사전 훈련된 언어 모델과 교차 모달 매칭 모델의 통합은 복잡하거나 추상적이거나 예술적인 프롬프트에 더 잘 부합하는 더 높은 샘플 정확도를 제공한다.
  • UniBench에서의 평가 결과, 캡션 유사도와 미적 품질을 포함한 모든 평가 지표에서 디스코 디퓨전과 스테이블 디퓨전과 같은 강력한 베이스라인을 초월하는 성능을 보였다.
  • 아블레이션 연구를 통해 교차 모달 가이던스가 복잡한 장면에서 언어적 뉘앙스가 중요한 경우에 특히 생성 품질 향상에 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.