Skip to main content
QUICK REVIEW

[论文解读] Leveraging Visual Question Answering to Improve Text-to-Image Synthesis

Stanislav Frolov, Shailza Jolly|arXiv (Cornell University)|Oct 28, 2020
Multimodal Machine Learning Applications参考文献 31被引用 7
一句话总结

该论文提出一种方法,通过利用 VQA 2.0 数据集中的视觉问答(VQA)数据来提升文本到图像(T2I)生成的质量。通过将问题-答案对作为额外训练输入,并使用预训练的 VQA 模型提供辅助损失,该方法增强了图像的真实感和图文对齐效果,将 FID 从 27.84 降低至 25.38,同时将 R-prec. 从 83.82% 提升至 84.79%。

ABSTRACT

Generating images from textual descriptions has recently attracted a lot of interest. While current models can generate photo-realistic images of individual objects such as birds and human faces, synthesising images with multiple objects is still very difficult. In this paper, we propose an effective way to combine Text-to-Image (T2I) synthesis with Visual Question Answering (VQA) to improve the image quality and image-text alignment of generated images by leveraging the VQA 2.0 dataset. We create additional training samples by concatenating question and answer (QA) pairs and employ a standard VQA model to provide the T2I model with an auxiliary learning signal. We encourage images generated from QA pairs to look realistic and additionally minimize an external VQA loss. Our method lowers the FID from 27.84 to 25.38 and increases the R-prec. from 83.82% to 84.79% when compared to the baseline, which indicates that T2I synthesis can successfully be improved using a standard VQA model.

研究动机与目标

  • 提升文本到图像生成图像的真实感与语义对齐效果,尤其针对多物体场景中的挑战。
  • 解决当前 T2I 模型在生成包含多个物体的复杂描述时难以生成照片级真实感图像的局限性。
  • 利用 VQA 2.0 数据集中丰富、多样且详尽的监督信号,增强训练信号,超越标准图像描述的监督。
  • 探索辅助 VQA 监督是否能在无需复杂架构修改的情况下提升图像质量与对齐效果。
  • 研究在 T2I 训练过程中使用标准预训练 VQA 模型作为外部损失信号的有效性。

提出的方法

  • 从 VQA 2.0 数据集中拼接问题与答案(QA)对,为 T2I 模型创建额外的训练样本。
  • 在 AttnGAN 架构基础上扩展,增加一个独立分支的 VQA 模型,用于处理由 QA 对生成的图像。
  • 引入外部 VQA 损失,引导生成器产出不仅真实感强,而且与 QA 输入语义一致的图像。
  • 修改训练目标,联合优化标准 AttnGAN 损失(对抗损失与 DAMSM 损失)以及由 QA 对生成图像的 VQA 损失。
  • 训练生成器以最小化对抗损失(来自判别器)和 DAMSM 损失(用于图像-文本对齐),同时最小化 VQA 损失。
  • 使用预训练的 VQA 模型在 QA 对生成的图像上计算 VQA 损失,提供一种辅助信号,以促进对细粒度视觉内容的定位。

实验结果

研究问题

  • RQ1是否可以通过将 VQA 2.0 的 QA 对作为额外训练输入,提升文本到图像生成图像的真实感与对齐效果?
  • RQ2在 T2I 训练目标中增加外部 VQA 损失,是否能相比标准 T2I 训练获得更好的图像质量与语义一致性?
  • RQ3当要求由 QA 对生成的图像在保持真实感的同时,也能被 VQA 模型正确回答时,T2I 模型的性能如何变化?
  • RQ4是否可以通过简单集成一个预训练的 VQA 模型,在不增加架构复杂性或布局监督的前提下,改善 FID 与 R-prec.?
  • RQ5VQA 2.0 中 QA 对的多样性,包括互补的图像-答案对,对模型关注细粒度细节能力的提升程度如何?

主要发现

  • 所提方法将 Fréchet Inception Distance(FID)从 27.84 降低至 25.38,表明图像质量与多样性有显著提升。
  • R-prec. 指标从 83.82% 提升至 84.79%,表明生成图像与输入描述之间的语义对齐效果更好。
  • 在 QA 对生成的图像上,VQA 准确率从 43.00% 提升至 43.75%,证实图像更具语义基础性且可回答。
  • 仅添加外部 VQA 损失而不调整整体目标权重会导致性能下降,表明需要平衡优化。
  • 当生成器联合优化对抗真实性、图像-文本对齐(DAMSM)与 VQA 一致性时,可获得最佳结果。
  • 该方法表明,即使使用标准预训练的 VQA 模型,只要与强大的 T2I 主干网络(如 AttnGAN)结合,也能提供有效的监督。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。