Skip to main content
QUICK REVIEW

[论文解读] Attribute-Centric Compositional Text-to-Image Generation

Yuren Cong, Martin Renqiang Min|arXiv (Cornell University)|Jan 4, 2023
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

该论文提出ACTIG,一种新颖的以属性为中心的组合式文本到图像生成框架,通过基于属性的特征增强和无图像训练范式,提升了对低频属性组合的泛化能力。通过引入以属性为中心的对比损失,ACTIG减少了对高频属性的过拟合,在CelebA-HQ和CUB数据集上实现了图像质量和文本-图像一致性方面的最先进性能。

ABSTRACT

Despite the recent impressive breakthroughs in text-to-image generation, generative models have difficulty in capturing the data distribution of underrepresented attribute compositions while over-memorizing overrepresented attribute compositions, which raises public concerns about their robustness and fairness. To tackle this challenge, we propose ACTIG, an attribute-centric compositional text-to-image generation framework. We present an attribute-centric feature augmentation and a novel image-free training scheme, which greatly improves model's ability to generate images with underrepresented attributes. We further propose an attribute-centric contrastive loss to avoid overfitting to overrepresented attribute compositions. We validate our framework on the CelebA-HQ and CUB datasets. Extensive experiments show that the compositional generalization of ACTIG is outstanding, and our framework outperforms previous works in terms of image quality and text-image consistency.

研究动机与目标

  • 解决文本到图像模型在低频属性组合上泛化能力差的挑战。
  • 减少训练数据中对高频属性组合的过拟合。
  • 通过学习更均衡的属性特征分布,提升模型的鲁棒性和公平性。
  • 实现对文本提示中罕见或未见属性组合的高保真图像生成。
  • 开发一种不依赖真实图像数据的训练范式,以应对低频属性组合的数据稀缺问题。

提出的方法

  • 通过CLIP编码器生成文本特征,并利用文本到图像映射网络将这些特征映射到图像特征,实现基于属性的特征增强。
  • 提出一种无图像训练方案,仅使用文本特征和合成图像特征进行模型训练,绕过罕见属性组合的真实图像数据。
  • 设计一种以属性为中心的对比损失,以解耦属性表征,防止对频繁属性组合的过度记忆。
  • 在完全监督训练和无图像训练之间交替进行,以平衡从真实数据和罕见组合中学习的能力。
  • 使用基于CLIP的文本编码器和可学习的映射网络,从增强的文本特征生成图像特征。
  • 通过字符串匹配(CelebA-HQ)和依存句法分析(CUB)进行属性提取,用于对比损失训练。

实验结果

研究问题

  • RQ1以属性为中心的训练范式是否能提升文本到图像生成中对低频属性组合的泛化能力?
  • RQ2使用合成图像特征的无图像训练在补偿罕见属性组合的数据稀疏性方面效果如何?
  • RQ3以属性为中心的对比损失在多大程度上减少了对高频属性组合的过拟合?
  • RQ4所提出的框架是否能在提升罕见属性组合的文本-图像对齐性的同时保持高图像质量?
  • RQ5在鲁棒性、公平性和组合泛化能力方面,ACTIG与现有方法相比表现如何?

主要发现

  • ACTIG在CelebA-HQ和CUB两个数据集上均实现了图像质量和文本-图像一致性的最先进性能。
  • 即使在训练过程中未见过的属性组合,该模型仍能生成高保真图像,展现出强大的组合泛化能力。
  • 用户研究表明,ACTIG在图像质量和与输入文本的对齐性方面均优于先前的模型(如StyleT2I和Lafite)。
  • 无图像训练方案有效提升了对低频属性组合的生成效果,且无需依赖真实图像数据。
  • 以属性为中心的对比损失成功减少了对频繁属性组合的过拟合,提升了模型的公平性。
  • 定性结果表明,与现有方法相比,ACTIG生成的图像更具真实感且语义对齐性更好,尤其在罕见属性组合上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。