Skip to main content
QUICK REVIEW

[논문 리뷰] Attribute-Centric Compositional Text-to-Image Generation

Yuren Cong, Martin Renqiang Min|arXiv (Cornell University)|2023. 01. 04.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 구성적 텍스트-이미지 생성을 위한 새로운 속성 중심 프레임워크인 ACTIG를 제안한다. 이 프레임워크는 속성 중심 특징 증강과 이미지 없는 학습 파라다임을 통해 희귀한 속성 조합에 대한 일반화 능력을 향상시킨다. 속성 중심의 대비 손실을 도입함으로써 과도하게 반복되는 속성에 대한 과적합을 줄이고, CelebA-HQ와 CUB에서 이미지 품질과 텍스트-이미지 일致성 측면에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

Despite the recent impressive breakthroughs in text-to-image generation, generative models have difficulty in capturing the data distribution of underrepresented attribute compositions while over-memorizing overrepresented attribute compositions, which raises public concerns about their robustness and fairness. To tackle this challenge, we propose ACTIG, an attribute-centric compositional text-to-image generation framework. We present an attribute-centric feature augmentation and a novel image-free training scheme, which greatly improves model's ability to generate images with underrepresented attributes. We further propose an attribute-centric contrastive loss to avoid overfitting to overrepresented attribute compositions. We validate our framework on the CelebA-HQ and CUB datasets. Extensive experiments show that the compositional generalization of ACTIG is outstanding, and our framework outperforms previous works in terms of image quality and text-image consistency.

연구 동기 및 목표

  • 희귀한 속성 조합에 대한 텍스트-이미지 모델의 일반화 능력이 열 劣하는 문제를 해결한다.
  • 학습 데이터에서 과도하게 반복되는 속성 조합에 대한 과적합을 줄인다.
  • 더 균형 잡힌 속성 특징 분포를 학습함으로써 모델의 강건성과 공정성을 향상시킨다.
  • 텍스트 프롬프트에 포함된 희귀하거나 미리 보지 못한 속성 조합에 기반해 고해상도 이미지를 생성할 수 있도록 한다.
  • 희귀한 조합에 대해 실제 이미지를 사용하지 않는 학습 파라다임을 개발한다.

제안 방법

  • CLIP 인코더를 통해 텍스트 특징를 생성하고, 이를 텍스트-이미지 매핑 네트워크를 통해 이미지 특징로 매핑함으로써 속성 중심의 특징 증강을 도입한다.
  • 실제 이미지 데이터를 희귀한 조합에 대해 생략하고, 오직 텍스트 특징와 합성된 이미지 특징만을 사용해 모델을 학습하는 이미지 없는 학습 체계를 제안한다.
  • 속성 표현을 분리하고 빈번한 속성 조합에 대한 과기억을 방지하기 위해 속성 중심의 대비 손실을 설계한다.
  • 완전한 지도 학습과 이미지 없는 학습을 번갈아 수행하여 실제 데이터와 희귀한 조합에서의 학습을 균형 있게 유지한다.
  • CLIP 기반의 텍스트 인코더와 학습된 매핑 네트워크를 사용해 증강된 텍스트 특징에서 이미지 특징를 생성한다.
  • 대비 손실 학습을 위해 문자열 매칭(CelebA-HQ)과 의존성 파싱(CUB)을 통해 속성 추출을 수행한다.

실험 결과

연구 질문

  • RQ1속성 중심의 학습 파라다임은 텍스트-이미지 생성에서 희귀한 속성 조합에 대한 일반화 능력을 향상시키는가?
  • RQ2합성된 이미지 특징를 사용한 이미지 없는 학습은 희귀한 속성 조합의 데이터 부족 문제를 얼마나 효과적으로 보완하는가?
  • RQ3속성 중심의 대비 손실은 과도하게 반복되는 속성 조합에 대한 과적합을 어느 정도 줄이는가?
  • RQ4제안된 프레임워크는 희귀한 속성 조합에 대해 고해상도 이미지 품질을 유지하면서도 텍스트-이미지 일치성을 향상시킬 수 있는가?
  • RQ5강건성, 공정성, 구성적 일반화 측면에서 ACTIG는 기존 방법들과 비교해 어떻게 성능을 내는가?

주요 결과

  • ACTIG는 CelebA-HQ와 CUB 데이터셋 모두에서 이미지 품질과 텍스트-이미지 일치성 측면에서 최신 기술 수준(SOTA)의 성능을 달성한다.
  • 모델은 훈련 중에 볼 수 없었던 속성 조합에 대해서도 고해상도 이미지를 생성하여 구성적 일반화 능력이 뛰어나다는 것을 입증한다.
  • 사용자 연구 결과, ACTIG는 StyleT2I와 Lafite와 같은 기존 모델보다 이미지 품질과 입력 텍스트와의 일치성에서 뛰어난 성능을 보였다.
  • 이미지 없는 학습 체계는 실제 이미지를 사용하지 않고도 희귀한 속성 조합의 생성 능력을 효과적으로 향상시킨다.
  • 속성 중심의 대비 손실은 자주 나타나는 속성 조합에 대한 과적합을 성공적으로 줄여 모델의 공정성을 향상시켰다.
  • 정성적 결과는 ACTIG가 존재하는 방법들보다 더 현실적이며 의미적으로 일치하는 이미지를 생성함을 확인한다. 특히 희귀한 속성 조합에 대해 뚜렷한 우수성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.