Skip to main content
QUICK REVIEW

[论文解读] Text-to-Image Generation with Attention Based Recurrent Neural Networks

Tehseen Zia, Shahan Arif|arXiv (Cornell University)|Jan 18, 2020
Video Analysis and Summarization参考文献 24被引用 6
一句话总结

本文提出了一种基于注意力机制的自回归图像生成模型,通过编码器-解码器框架,利用词到像素的注意力机制和像素到像素的自回归预测,从文本描述生成高质量图像。该模型在 MS-COCO 和 MNIST-with-captions 数据集上实现了最先进性能,通过端到端训练而无需外部目标检测器,在结构相似性和召回率指标上优于先前方法。

ABSTRACT

Conditional image modeling based on textual descriptions is a relatively new domain in unsupervised learning. Previous approaches use a latent variable model and generative adversarial networks. While the formers are approximated by using variational auto-encoders and rely on the intractable inference that can hamper their performance, the latter is unstable to train due to Nash equilibrium based objective function. We develop a tractable and stable caption-based image generation model. The model uses an attention-based encoder to learn word-to-pixel dependencies. A conditional autoregressive based decoder is used for learning pixel-to-pixel dependencies and generating images. Experimentations are performed on Microsoft COCO, and MNIST-with-captions datasets and performance is evaluated by using the Structural Similarity Index. Results show that the proposed model performs better than contemporary approaches and generate better quality images. Keywords: Generative image modeling, autoregressive image modeling, caption-based image generation, neural attention, recurrent neural networks.

研究动机与目标

  • 开发一种可计算且稳定的基于文本描述的图像生成模型,避免 GAN 的不稳定性以及 VAE 的不可计算推理问题。
  • 通过端到端学习潜在的词到像素对齐,消除对第三方目标检测器或分割模型的依赖。
  • 通过在统一的自回归框架中建模语言语义和像素级依赖关系,提升图像生成质量。
  • 通过结构相似性和召回率等指标,在基准数据集上展示优越性能。

提出的方法

  • 使用基于注意力机制的编码器,学习文本描述中的词语与图像区域之间的对齐关系。
  • 采用条件自回归解码器,基于已生成的像素逐步生成新像素。
  • 引入双路径学习机制:词到像素的注意力用于语义引导,像素到像素的自回归用于空间一致性。
  • 通过像素序列的最大似然估计进行端到端训练。
  • 利用 RNN 架构建模语言和图像空间中的长距离依赖关系。
  • 采用基于像素级重建的结构化损失函数,以提升生成图像的保真度。

实验结果

研究问题

  • RQ1是否能够通过端到端的基于注意力机制的自回归模型,在不依赖外部目标检测器的情况下,从文本描述生成高质量图像?
  • RQ2与使用固定或预计算图像结构的模型相比,基于注意力机制的词到像素对齐在多大程度上提升了图像生成质量?
  • RQ3在文本到图像生成任务中,基于注意力机制的自回归建模是否相比 GAN 或 VAE 方法具有更好的稳定性和性能?
  • RQ4在推理阶段,该模型在未见的文本描述上具有多大程度的泛化能力?

主要发现

  • 在 MS-COCO 数据集上,所提出的 alignPixelRNN 模型取得了 0.166 ± 0.12 的结构相似性指数(SSI),优于所有基线模型,包括 alignDRAW(0.156 ± 0.11)。
  • 该模型在 MS-COCO 上的 recall@50 达到 80.5,显著高于次优基线模型 alignDRAW 的 68.5。
  • 在 MNIST-with-captions 数据集上,该模型的 recall@50 达到 88,SSI 为 0.356 ± 0.35,表明在更简单、结构化更强的数据上表现优异。
  • 视觉样本显示,与仅单次生成并迭代优化的基线 alignDRAW 相比,该模型生成的图像更清晰、更连贯。
  • 模型性能稳定,泛化能力良好,训练与验证损失曲线一致,过拟合现象极少。
  • 注意力机制使模型能够学习抽象概念层面的对齐关系,而无需显式目标检测,从而实现真正的端到端学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。