Skip to main content
QUICK REVIEW

[论文解读] CPGAN: Full-Spectrum Content-Parsing Generative Adversarial Networks for Text-to-Image Synthesis

Jiadong Liang, Wenjie Pei|arXiv (Cornell University)|Dec 18, 2019
Generative Adversarial Networks and Image Synthesis参考文献 53被引用 6
一句话总结

CPGAN 提出了一种全谱内容解析框架,用于文本到图像的合成,通过联合使用记忆注意力机制(MATE)解析文本输入和基于对象感知的图像编码器(OAIE)解析生成的图像,同时采用细粒度条件判别器(FGCD)将词语与图像子区域对齐,从而增强语义对齐。该方法实现了最先进性能,在 COCO 数据集上的 Inception Score 从 35.69 提升至 52.73,显著提高了语义一致性和图像真实感。

ABSTRACT

Typical methods for text-to-image synthesis seek to design effective generative architecture to model the text-to-image mapping directly. It is fairly arduous due to the cross-modality translation. In this paper we circumvent this problem by focusing on parsing the content of both the input text and the synthesized image thoroughly to model the text-to-image consistency in the semantic level. Particularly, we design a memory structure to parse the textual content by exploring semantic correspondence between each word in the vocabulary to its various visual contexts across relevant images during text encoding. Meanwhile, the synthesized image is parsed to learn its semantics in an object-aware manner. Moreover, we customize a conditional discriminator to model the fine-grained correlations between words and image sub-regions to push for the text-image semantic alignment. Extensive experiments on COCO dataset manifest that our model advances the state-of-the-art performance significantly (from 35.69 to 52.73 in Inception Score).

研究动机与目标

  • 为解决文本到图像合成中的跨模态语义对齐挑战,从直接映射转向显式内容解析。
  • 通过在文本编码过程中使用记忆机制建模词级视觉上下文,提升图像保真度和语义一致性。
  • 通过对象感知的语义解析方法,提升对生成图像的视觉语义理解。
  • 通过建模局部词-子区域相关性的细粒度条件判别器,优化文本与图像的对齐。
  • 在 COCO 数据集上实现定量指标与人类评估的最先进性能。

提出的方法

  • 提出记忆注意力文本编码器(MATE),通过学习训练数据中相关图像之间的语义对应关系,为每个词捕捉视觉上下文。
  • 引入对象感知图像编码器(OAIE),将生成图像解析为语义组件,以获得更优的视觉表征。
  • 设计细粒度条件判别器(FGCD),评估词语与图像子区域之间的局部对齐,以强化语义一致性。
  • 采用内容解析增强的粗到细生成框架,使文本与图像语义在共享语义空间中对齐。
  • 在 FGCD 中采用基于图像块的判别策略,以减少模型参数量,同时保持高性能。
  • 在 GAN 框架中整合 MATE、OAIE 和 FGCD,联合优化生成质量与语义对齐。

实验结果

研究问题

  • RQ1对文本和生成图像进行显式内容解析,是否能提升文本到图像合成中的语义一致性?
  • RQ2在文本编码过程中,如何有效建模词级视觉上下文,以提升与图像区域的对齐?
  • RQ3对象感知图像解析在多大程度上能增强生成图像的语义表征?
  • RQ4建模局部词-子区域相关性的细粒度条件判别器,是否能显著提升生成质量与对齐效果?
  • RQ5全谱内容解析是否能在定量指标与人类评估中带来可测量的性能提升?

主要发现

  • CPGAN 在 COCO 数据集上实现了 52.73 的最先进 Inception Score,相比之前最先进方法(35.69)提升了 47.74%。
  • 模型在 R-precision 上达到 93.59%,SOA-C 为 77.02%,SOA-I 为 84.55%,在所有指标上均显著优于先前方法。
  • 人类评估显示,CPGAN 在成对比较中获得 63.73% 的投票,优于 AttnGAN(28.33%)和 StackGAN(7.94%)。
  • 尽管性能更优,模型参数量降低至 318M,显著少于 AttnGAN(956M)和 StackGAN(996M)。
  • 定性结果表明,CPGAN 生成的图像更具真实感和语义一致性,尤其在涉及多个物体及交互的复杂场景中表现更优。
  • 消融实验证实,MATE、OAIE 和 FGCD 三个组件均对整体性能提升有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。