Skip to main content
QUICK REVIEW

[论文解读] Text to Image Generation with Semantic-Spatial Aware GAN

Kai Hu, Wentong Liao|arXiv (Cornell University)|Apr 1, 2021
Generative Adversarial Networks and Image Synthesis被引用 11
一句话总结

本文提出了一种新型文本到图像生成框架——语义-空间感知生成对抗网络(SSA-GAN),通过引入可学习掩码预测器和语义自适应批归一化,增强了文本描述与生成图像之间的语义与空间对齐。该模型采用语义-空间感知卷积网络(SSACN),支持端到端训练,并联合优化文本编码器,在 COCO 和 CUB 数据集上均实现了生成质量与对齐度的最先进性能,指标包括 Inception Score 与 Fréchet Inception Distance。

ABSTRACT

Text-to-image synthesis (T2I) aims to generate photo-realistic images which are semantically consistent with the text descriptions. Existing methods are usually built upon conditional generative adversarial networks (GANs) and initialize an image from noise with sentence embedding, and then refine the features with fine-grained word embedding iteratively. A close inspection of their generated images reveals a major limitation: even though the generated image holistically matches the description, individual image regions or parts of somethings are often not recognizable or consistent with words in the sentence, e.g. "a white crown". To address this problem, we propose a novel framework Semantic-Spatial Aware GAN for synthesizing images from input text. Concretely, we introduce a simple and effective Semantic-Spatial Aware block, which (1) learns semantic-adaptive transformation conditioned on text to effectively fuse text features and image features, and (2) learns a semantic mask in a weakly-supervised way that depends on the current text-image fusion process in order to guide the transformation spatially. Experiments on the challenging COCO and CUB bird datasets demonstrate the advantage of our method over the recent state-of-the-art approaches, regarding both visual fidelity and alignment with input text description.

研究动机与目标

  • 为解决现有文本到图像 GAN 在有效融合文本与图像特征方面的局限性,特别是语义与空间一致性保持不足的问题。
  • 通过将文本编码器与图像生成器联合优化,克服因固定文本编码器导致的次优性能。
  • 通过学习基于文本描述全局与局部语义的时空自适应变换,改进特征融合。
  • 开发一种弱监督掩码预测机制,动态引导将文本信息注入图像特征的特定区域。
  • 在标准基准数据集 COCO 与 CUB 上实现图像质量与图文对齐度的最先进结果。

提出的方法

  • 提出一种语义-空间感知卷积网络(SSACN),集成语义-空间条件批归一化(SSCBN)模块,对图像特征施加基于文本的仿射变换。
  • 引入一种弱监督掩码预测器,基于当前融合状态生成空间注意力图,确保与文本相关区域获得更强的特征调制。
  • 在 SSACN 中采用残差块,以在文本无关区域保留图像特征,维持特征变换过程中的结构完整性。
  • 采用端到端训练整个模型,使文本编码器可与生成器联合微调,提升生成任务中的文本表征学习能力。
  • 利用多尺度特征融合策略,通过注意力机制将全局与局部图像特征,与词级与句级文本特征进行融合。
  • 采用 DAMSM 损失进行训练,通过余弦相似度与归一化注意力权重,计算图像子区域与文本词之间的匹配分数。

实验结果

研究问题

  • RQ1文本编码器与图像生成器的端到端训练是否能提升文本到图像合成中生成图像的质量与对齐度?
  • RQ2在特征融合过程中学习空间自适应注意力掩码是否能提升文本描述与生成图像之间的语义一致性?
  • RQ3与标准或全局 CBN 方法相比,基于文本特征条件化的语义自适应批归一化层是否能提升特征融合效果?
  • RQ4在标准基准数据集上,该方法在视觉保真度与图文对齐度方面与最先进模型相比表现如何?
  • RQ5弱监督掩码预测模块在引导将文本信息注入相关图像区域方面有何贡献?

主要发现

  • 在 COCO 数据集上,SSA-GAN 的 Fréchet Inception Distance(FID)达到 13.8,优于先前最先进方法。
  • 在 CUB 鸟类数据集上,SSA-GAN 的 Inception Score 达到 148.7,展现出更优的图像质量与多样性。
  • 消融实验表明,语义自适应批归一化与掩码预测模块均显著提升了图文对齐度与视觉质量。
  • 文本编码器的联合训练使文本表征学习能力得到提升,表现为注意力图更清晰,DAMSM 损失中的匹配分数更高。
  • 通过修改输入文本描述,模型可实现有效图像编辑,生成图像能语义与空间上自适应响应新描述。
  • 所提出的掩码预测机制生成的注意力图具有一致性,能与文本语义内容良好对齐,例如在鸟类图像中突出显示翅膀或眼睛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。