Skip to main content
QUICK REVIEW

[论文解读] I2T2I: Learning Text to Image Synthesis with Textual Data Augmentation

Hao Dong, Jingqing Zhang|arXiv (Cornell University)|Mar 20, 2017
Multimodal Machine Learning Applications被引用 18
一句话总结

本文提出 I2T2I,一种新颖的训练方法,通过图像字幕生成与图文映射的循环机制,利用文本数据增强来提升文本到图像生成的质量。通过联合训练预训练的图像字幕模块、基于 GAN 的生成器以及对比图文嵌入模块,I2T2I 在多类别数据集(如 MSCOCO)上提升了生成质量,并在未标注字幕的 MPII 人体姿态数据集上实现了零样本迁移学习,无需人工标注的字幕,实现了复杂人体与物体生成中更优的细节与真实感。

ABSTRACT

Translating information between text and image is a fundamental problem in artificial intelligence that connects natural language processing and computer vision. In the past few years, performance in image caption generation has seen significant improvement through the adoption of recurrent neural networks (RNN). Meanwhile, text-to-image generation begun to generate plausible images using datasets of specific categories like birds and flowers. We've even seen image generation from multi-category datasets such as the Microsoft Common Objects in Context (MSCOCO) through the use of generative adversarial networks (GANs). Synthesizing objects with a complex shape, however, is still challenging. For example, animals and humans have many degrees of freedom, which means that they can take on many complex shapes. We propose a new training method called Image-Text-Image (I2T2I) which integrates text-to-image and image-to-text (image captioning) synthesis to improve the performance of text-to-image synthesis. We demonstrate that %the capability of our method to understand the sentence descriptions, so as to I2T2I can generate better multi-categories images using MSCOCO than the state-of-the-art. We also demonstrate that I2T2I can achieve transfer learning by using a pre-trained image captioning module to generate human images on the MPII Human Pose

研究动机与目标

  • 为解决多模态文本到图像生成的挑战,特别是针对人类和动物等复杂、高变化度主体的生成问题。
  • 克服如 MSCOCO 等数据集中缺乏多样化、多描述性标注的问题,此类问题限制了文本到图像生成的性能。
  • 实现在无句子标注图像数据集(如 MPII 人体姿态数据集)上的零样本迁移学习。
  • 提升生成图像的保真度与细节,尤其针对复杂形状与动态姿态的生成。

提出的方法

  • I2T2I 集成三个模块:用于文本数据增强的图像字幕模块、用于视觉-语义嵌入的图文映射模块,以及基于 GAN 的图像生成模块。
  • 图像字幕模块使用带有 top-k 采样(k=3)的 LSTM 解码器,为每张图像生成多个多样化字幕,提升训练数据的多样性。
  • 图文映射模块基于余弦相似度设计对比损失函数,将图像与句子嵌入对齐于共享潜在空间,最大化匹配对之间的相似度,同时最小化不匹配对之间的相似度。
  • GAN-CLS 生成器同时以图像字幕嵌入与噪声向量为条件输入,复用图文模块中的 RNN 编码器以增强语义对齐。
  • 训练过程中,每轮迭代均重新生成合成字幕,并通过随机旋转、翻转与裁剪对图像实施数据增强。
  • 采用 Adam 优化器进行端到端训练,配合学习率衰减策略,联合优化字幕生成与 GAN 模块。

实验结果

研究问题

  • RQ1通过图像字幕生成实现的文本数据增强,是否能提升多类别数据集(如 MSCOCO)上文本到图像生成的质量与多样性?
  • RQ2I2T2I 框架是否能在无人工标注字幕的数据集(如 MPII 人体姿态数据集)上实现有效的零样本迁移学习?
  • RQ3图像字幕与图文映射的整合是否能提升模型生成复杂、高变化度主体(如人类与动物)的能力?
  • RQ4I2T2I 与 SOTA 方法(如 GAN-CLS)相比,在生成细节丰富且逼真的图像方面表现如何?

主要发现

  • 在 MSCOCO 验证集上,I2T2I 在生成高质量图像方面优于 GAN-CLS,尤其在捕捉细粒度细节(如人体腿部、波浪,以及马桶、公交车等复杂物体)方面表现更优。
  • 该方法仅依赖来自 MSCOCO 的预训练图像字幕模块,无需任何人工标注的句子描述,成功在 MPII 人体姿态数据集上生成逼真的姿态与动态场景。
  • 定性结果表明,与 GAN-CLS 相比,I2T2I 生成的复杂形状与多对象场景更具准确性与细节表现力。
  • 通过图像字幕模块生成的合成字幕显著提升了训练数据的多样性与鲁棒性,增强了生成器对同一图像多种描述的泛化能力。
  • 字幕生成、嵌入学习与 GAN 模块的联合训练,带来了更优的语义对齐效果,并显著提升了在未见数据集上的零样本迁移性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。