Skip to main content
QUICK REVIEW

[论文解读] GILT: Generating Images from Long Text

Ori Bar El, Ori Licht|arXiv (Cornell University)|Jan 8, 2019
Image Retrieval and Classification Techniques参考文献 17被引用 10
一句话总结

本文提出 GILT,一种新颖的任务与基线,用于从长篇复杂文本描述(如完整食谱)生成高分辨率(256×256)的美食图像,且无需直接的视觉描述。该方法采用基于两种食谱嵌入类型(基于余弦相似度的 NOREG 与语义正则化的 REG)的 StackGAN-v2 条件生成,发现尽管 REG 在分类任务中表现更优,NOREG 在生成更具多样性与照片级真实感的图像方面表现更佳。

ABSTRACT

Creating an image reflecting the content of a long text is a complex process that requires a sense of creativity. For example, creating a book cover or a movie poster based on their summary or a food image based on its recipe. In this paper we present the new task of generating images from long text that does not describe the visual content of the image directly. For this, we build a system for generating high-resolution 256 $ imes$ 256 images of food conditioned on their recipes. The relation between the recipe text (without its title) to the visual content of the image is vague, and the textual structure of recipes is complex, consisting of two sections (ingredients and instructions) both containing multiple sentences. We used the recipe1M dataset to train and evaluate our model that is based on a the StackGAN-v2 architecture.

研究动机与目标

  • 建立一项新任务:从长篇非视觉文本描述(如完整食谱)生成高分辨率图像。
  • 开发一种基于条件 GAN 的基线系统,用于根据复杂、多部分的食谱(包括食材与步骤)生成图像。
  • 在文本到图像生成的背景下,比较两种食谱嵌入方法——NOREG(无语义正则化)与 REG(有语义正则化)的效果。
  • 通过定量指标(Inception Score、MS-SSIM)与人工评估(图像真实感、食谱-图像相关性、视觉合理性)综合评估图像质量与多样性。

提出的方法

  • 该模型使用 StackGAN-v2 通过多阶段过程生成 256×256 图像,从低分辨率噪声向量开始,经由多轮生成器与判别器阶段逐步优化。
  • 生成器与判别器均以代表整个食谱(不包括标题)的单一嵌入向量为条件,该向量来自通过食谱与图像嵌入之间的余弦相似度损失学习得到的联合嵌入空间。
  • 采用两种嵌入方法:NOREG 仅基于食谱与图像嵌入之间的余弦相似度;REG 在此基础上增加高层分类损失以正则化嵌入空间。
  • 食谱嵌入通过两步过程计算:首先学习食材与步骤的初步嵌入,然后将两者拼接,并与图像联合嵌入到共享语义空间中。
  • 训练目标遵循标准最小最大 GAN 损失,采用条件 GAN 公式:min_G max_D E[log D(x)] + E[log(1 - D(G(z,c)))],其中 c 为食谱嵌入。
  • 评估包括 Inception Score、MS-SSIM(用于多样性评估),以及人工评分在三个维度上的表现:食谱-图像相关性、图像真实感、图像-食谱一致性。

实验结果

研究问题

  • RQ1条件 GAN 是否能够从长篇非视觉文本描述(如完整食谱)生成高分辨率、照片级真实的美食图像?
  • RQ2不同的食谱嵌入策略——特别是带有与不带有语义正则化——如何影响文本到图像生成中的图像质量与多样性?
  • RQ3即使在低质量、高变异性的数据集(如 recipe1M)上进行训练,模型是否仍能生成真实且多样的输出,尽管存在图像噪声与光照不良问题?
  • RQ4在分类任务(如 1048 种食物类别)中,食谱嵌入方法的表现是否能预测其在图像生成任务中的成功?
  • RQ5人工评估中图像真实感与食谱相关性的判断,在多大程度上与 Inception Score 和 MS-SSIM 等自动化指标相关?

主要发现

  • NOREG 嵌入方法(无语义正则化)的 Inception Score(4.55 ± 0.20)高于 REG(4.42 ± 0.17),表明其在图像质量和多样性方面表现更优。
  • 人工评估显示,NOREG 生成的图像在真实感(3.72)与食谱-图像相关性(2.88)方面显著优于 REG(分别为 3.05 与 2.62)。
  • MS-SSIM 评分证实,NOREG 生成的图像更具多样性(0.07),而 REG 的多样性较低(0.17),其中更低的 MS-SSIM 值表示更高的图像多样性。
  • 尽管 REG 在原始分类任务中表现更优(如文献 [11] 所述),其在图像生成任务中表现较差,生成的图像更模糊、更不真实。
  • 该模型成功生成了类似粥类食物(如汤、米饭、意大利面)的逼真图像,但对具有明显形状特征的食物(如汉堡、饮料)生成效果较差,可能由于训练数据集中图像质量较低。
  • 在某些情况下,生成图像在人工评估中得分甚至高于真实图像,表明模型具备生成合理且逼真输出的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。