[论文解读] Text-to-Image Generation with Attention Based Recurrent Neural Networks
本文提出了一种基于注意力机制的自回归图像生成模型,通过编码器-解码器框架,利用词到像素的注意力机制和像素到像素的自回归预测,从文本描述生成高质量图像。该模型在 MS-COCO 和 MNIST-with-captions 数据集上实现了最先进性能,通过端到端训练而无需外部目标检测器,在结构相似性和召回率指标上优于先前方法。
Conditional image modeling based on textual descriptions is a relatively new domain in unsupervised learning. Previous approaches use a latent variable model and generative adversarial networks. While the formers are approximated by using variational auto-encoders and rely on the intractable inference that can hamper their performance, the latter is unstable to train due to Nash equilibrium based objective function. We develop a tractable and stable caption-based image generation model. The model uses an attention-based encoder to learn word-to-pixel dependencies. A conditional autoregressive based decoder is used for learning pixel-to-pixel dependencies and generating images. Experimentations are performed on Microsoft COCO, and MNIST-with-captions datasets and performance is evaluated by using the Structural Similarity Index. Results show that the proposed model performs better than contemporary approaches and generate better quality images. Keywords: Generative image modeling, autoregressive image modeling, caption-based image generation, neural attention, recurrent neural networks.
研究动机与目标
- 开发一种可计算且稳定的基于文本描述的图像生成模型,避免 GAN 的不稳定性以及 VAE 的不可计算推理问题。
- 通过端到端学习潜在的词到像素对齐,消除对第三方目标检测器或分割模型的依赖。
- 通过在统一的自回归框架中建模语言语义和像素级依赖关系,提升图像生成质量。
- 通过结构相似性和召回率等指标,在基准数据集上展示优越性能。
提出的方法
- 使用基于注意力机制的编码器,学习文本描述中的词语与图像区域之间的对齐关系。
- 采用条件自回归解码器,基于已生成的像素逐步生成新像素。
- 引入双路径学习机制:词到像素的注意力用于语义引导,像素到像素的自回归用于空间一致性。
- 通过像素序列的最大似然估计进行端到端训练。
- 利用 RNN 架构建模语言和图像空间中的长距离依赖关系。
- 采用基于像素级重建的结构化损失函数,以提升生成图像的保真度。
实验结果
研究问题
- RQ1是否能够通过端到端的基于注意力机制的自回归模型,在不依赖外部目标检测器的情况下,从文本描述生成高质量图像?
- RQ2与使用固定或预计算图像结构的模型相比,基于注意力机制的词到像素对齐在多大程度上提升了图像生成质量?
- RQ3在文本到图像生成任务中,基于注意力机制的自回归建模是否相比 GAN 或 VAE 方法具有更好的稳定性和性能?
- RQ4在推理阶段,该模型在未见的文本描述上具有多大程度的泛化能力?
主要发现
- 在 MS-COCO 数据集上,所提出的 alignPixelRNN 模型取得了 0.166 ± 0.12 的结构相似性指数(SSI),优于所有基线模型,包括 alignDRAW(0.156 ± 0.11)。
- 该模型在 MS-COCO 上的 recall@50 达到 80.5,显著高于次优基线模型 alignDRAW 的 68.5。
- 在 MNIST-with-captions 数据集上,该模型的 recall@50 达到 88,SSI 为 0.356 ± 0.35,表明在更简单、结构化更强的数据上表现优异。
- 视觉样本显示,与仅单次生成并迭代优化的基线 alignDRAW 相比,该模型生成的图像更清晰、更连贯。
- 模型性能稳定,泛化能力良好,训练与验证损失曲线一致,过拟合现象极少。
- 注意力机制使模型能够学习抽象概念层面的对齐关系,而无需显式目标检测,从而实现真正的端到端学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。