Skip to main content
QUICK REVIEW

[论文解读] The Art of Food: Meal Image Synthesis from Ingredients

Fangda Han, Ricardo Guerrero|arXiv (Cornell University)|May 9, 2019
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 4
一句话总结

本文提出了一种新颖的生成模型,通过注意力机制的食材-图像关联模型结合StackGAN-v2与循环一致性正则化,从文本形式的食材描述中合成逼真的餐品图像。该方法在图像质量和检索准确率方面达到最先进水平,通过学习到的嵌入表示有效实现了食材与视觉外观的解耦。

ABSTRACT

In this work we propose a new computational framework, based on generative deep models, for synthesis of photo-realistic food meal images from textual descriptions of its ingredients. Previous works on synthesis of images from text typically rely on pre-trained text models to extract text features, followed by a generative neural networks (GANs) aimed to generate realistic images conditioned on the text features. These works mainly focus on generating spatially compact and well-defined categories of objects, such as birds or flowers. In contrast, meal images are significantly more complex, consisting of multiple ingredients whose appearance and spatial qualities are further modified by cooking methods. We propose a method that first builds an attention-based ingredients-image association model, which is then used to condition a generative neural network tasked with synthesizing meal images. Furthermore, a cycle-consistent constraint is added to further improve image quality and control appearance. Extensive experiments show our model is able to generate meal image corresponding to the ingredients, which could be used to augment existing dataset for solving other computational food analysis problems.

研究动机与目标

  • 解决从食材列表生成逼真且多样化的餐品图像的挑战,该挑战因烹饪导致的食材外观变化以及部分食材在视觉上的消失而变得复杂。
  • 提升图像质量,并从视角、光照等干扰因素中解耦出与特定食材相关的视觉特征。
  • 通过生成受控成分的逼真合成餐品图像,实现计算食物分析中的数据增强。
  • 建模食材集合与其在成品菜肴中呈现的视觉外观之间的复杂非线性关系。

提出的方法

  • 训练一种基于注意力机制的食谱关联模型,将食材描述映射到共享嵌入空间(FoodSpace)中的图像特征,学习将食材与视觉外观相关联。
  • 模型使用StackGAN-v2作为生成器,以注意力模型提取的食材特征为条件,从随机噪声和食材嵌入中合成图像。
  • 通过将生成的图像编码回食材空间,引入循环一致性正则化,强制重构的食材与原始输入食材相匹配。
  • 在生成器中复用注意力模型的图像编码器,以确保图像生成与重建路径之间特征表示的一致性。
  • 通过标准词汇表处理食材,以统一输入表示,提升泛化能力与特征解耦效果。
  • 在FoodSpace中进行线性插值,以可视化添加或移除食材时图像外观的渐变过程。

实验结果

研究问题

  • RQ1深度生成模型能否仅基于食材列表生成逼真的餐品图像,同时捕捉视觉外观与空间布局?
  • RQ2如何在生成图像中将与特定食材相关的视觉特征与视角、光照等干扰因素解耦?
  • RQ3循环一致性正则化在多大程度上提升了生成餐品图像的质量与保真度?
  • RQ4当食材在最终图像中视觉上模糊或缺失时(如盐、油),模型能否生成与输入食材语义一致的图像?

主要发现

  • 在松饼子集上,所提模型的Fréchet Inception Distance(FID)为81.13,优于StackGAN-v2的104.73,表明图像质量更优。
  • 在沙拉子集上,所提模型的Inception Score(IS)为66.15,高于StackGAN-v2的58.40,表明生成图像在多样性和质量上更优。
  • 使用合成图像进行食谱检索时,所提模型的中位数排名(MedR)显著更低(如饼干类为103.3),低于StackGAN-v2的217.5,表明语义对齐性更优。
  • 在FoodSpace中进行线性插值可成功可视化目标食材(如番茄、蓝莓)的渐进移除过程,证实模型可通过潜在空间控制外观。
  • 使用相同随机向量但不同食材生成的图像保持一致的视角与光照,而使用相同食材但不同随机向量生成的图像在视角上存在差异,验证了内容与风格的解耦。
  • 结果表明,将食材处理为标准词汇表对有效图像合成与特征解耦至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。