Skip to main content
QUICK REVIEW

[论文解读] Semantics Disentangling for Text-to-Image Generation

Guojun Yin, Bin Liu|arXiv (Cornell University)|Apr 2, 2019
Generative Adversarial Networks and Image Synthesis参考文献 38被引用 12
一句话总结

本文提出 SD-GAN,一种文本到图像生成模型,通过将语义从多样化的语言描述中解耦,以提升图像生成的一致性和细节保真度。该模型使用孪生判别器来提炼高层语义一致性,并引入语义条件批归一化(SCBN)层以嵌入细粒度的语言线索,从而在 CUB 和 MS-COCO 数据集上实现最先进性能。

ABSTRACT

Synthesizing photo-realistic images from text descriptions is a challenging problem. Previous studies have shown remarkable progresses on visual quality of the generated images. In this paper, we consider semantics from the input text descriptions in helping render photo-realistic images. However, diverse linguistic expressions pose challenges in extracting consistent semantics even they depict the same thing. To this end, we propose a novel photo-realistic text-to-image generation model that implicitly disentangles semantics to both fulfill the high-level semantic consistency and low-level semantic diversity. To be specific, we design (1) a Siamese mechanism in the discriminator to learn consistent high-level semantics, and (2) a visual-semantic embedding strategy by semantic-conditioned batch normalization to find diverse low-level semantics. Extensive experiments and ablation studies on CUB and MS-COCO datasets demonstrate the superiority of the proposed method in comparison to state-of-the-art methods.

研究动机与目标

  • 为解决从同一图像的多样化语言描述中生成不一致图像的挑战。
  • 在保持低层次语义多样性和细粒度细节的同时,维持不同文本描述之间的高层语义一致性。
  • 提出一种新颖的框架,在无需显式文本到语义嵌入的情况下,隐式实现语义解耦。
  • 在 CUB 和 MS-COCO 等基准数据集上提升生成质量和一致性。

提出的方法

  • 采用孪生判别器架构,通过对比损失比较成对的文本描述,以强制实现语义一致性。
  • 孪生结构同时处理两对文本-图像样本,最小化同类对(相同图像、不同描述)的特征距离,同时最大化异类对(不同图像)的特征距离。
  • 提出语义条件批归一化(SCBN),将语言线索嵌入特征图,实现对视觉特征的细粒度控制。
  • SCBN 使用句子级或词级文本嵌入调节批归一化统计量,实现在生成过程中对特征图的动态自适应。
  • 模型通过联合对抗损失和对比损失进行训练,同时优化图像真实感和语义对齐。
  • 在 CUB-200 和 MS-COCO 数据集上,使用 FID 和 Inception Score 指标进行评估。

实验结果

研究问题

  • RQ1孪生判别器结构能否有效从同一图像的多样化语言描述中学习高层语义一致性?
  • RQ2在图像生成过程中,如何保留来自文本的低层次语义细节和多样性,以避免过度平滑或细粒度特征的丢失?
  • RQ3语义条件批归一化是否在视觉-语义对齐方面优于使用拼接文本特征的标准批归一化?
  • RQ4对比损失在生成器不同阶段的贡献如何,对整体生成质量和一致性有何影响?

主要发现

  • 所提出的 SD-GAN 在 CUB-200 数据集上达到最先进性能,Fréchet Inception Distance (FID) 为 4.67±0.09。
  • 在大规模 MS-COCO 数据集上,SD-GAN 的 FID 达到 35.69±0.50,优于先前方法。
  • 消融实验表明,在所有三个阶段(D1、D2、D3)应用对比损失可获得最佳性能,CUB 上 FID 为 4.67±0.09,MS-COCO 上为 35.69±0.50。
  • 使用词级语言线索的 SCBN 表现优于句子级线索,CUB 上 FID 为 4.45,而句子级为 4.39。
  • 将 SCBN 替换为标准批归一化并拼接文本特征后性能下降,证实 SCBN 在视觉-语义嵌入方面的优越性。
  • 该模型对语言表达差异具有鲁棒性,即使输入描述在措辞上显著不同,也能生成一致的图像。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。