Skip to main content
QUICK REVIEW

[论文解读] Recipe1M+: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images

Javier Marín, Aritro Biswas|arXiv (Cornell University)|Oct 14, 2018
Nutritional Studies and Diet被引用 14
一句话总结

Recipe1M+ 引入了一个大规模、结构化的数据集,包含超过一百万道烹饪食谱和1300万张食物图像,支持训练深度神经网络以学习食谱与图像之间的联合跨模态嵌入。通过高层次分类目标进行语义正则化,该模型在图像-食谱检索任务上达到人类水平性能,并支持有意义的语义向量算术运算,例如通过概念替换从'tacos'生成'lettuce wraps'。

ABSTRACT

In this paper, we introduce Recipe1M+, a new large-scale, structured corpus of over one million cooking recipes and 13 million food images. As the largest publicly available collection of recipe data, Recipe1M+ affords the ability to train high-capacity modelson aligned, multimodal data. Using these data, we train a neural network to learn a joint embedding of recipes and images that yields impressive results on an image-recipe retrieval task. Moreover, we demonstrate that regularization via the addition of a high-level classification objective both improves retrieval performance to rival that of humans and enables semantic vector arithmetic. We postulate that these embeddings will provide a basis for further exploration of the Recipe1M+ dataset and food and cooking in general. Code, data and models are publicly available.

研究动机与目标

  • 解决缺乏大规模、多模态数据集以学习烹饪食谱与食物图像联合表示的问题。
  • 在对齐且结构化的食谱与图像数据上训练高容量模型,以提升跨模态理解能力。
  • 开发一种学习语义正则化嵌入的神经模型,支持高级任务如语义算术和检索。
  • 证明使用高层次分类进行正则化可同时提升检索准确率和嵌入空间中的语义组合性。
  • 发布公开资源(代码、数据、模型),以推动食物理解、食谱生成和跨模态学习的研究。

提出的方法

  • 作者构建了 Recipe1M+,一个包含100万道食谱和1300万张从在线来源收集的食物图像的数据集,并对食材、步骤和图像元数据进行了结构化标注。
  • 他们训练了一个多模态神经网络,使用对比学习目标将食谱(文本)和图像联合嵌入到共享语义空间中。
  • 在模型中添加了一个高层次分类头,以正则化嵌入空间,提升语义对齐性和泛化能力。
  • 通过结合对比损失进行跨模态对齐和交叉熵损失进行高层次食物类别预测,对模型进行微调。
  • 通过在嵌入空间中操作向量表示来执行语义向量算术,例如类比推理(如:'taco' - 'tortilla' + 'lettuce' → 'lettuce wrap')。
  • 通过在两个概念向量之间插值(例如:'burrito' × x + 'sandwich' × (1−x))应用分数阶算术,探索食谱和图像空间中的连续过渡。

实验结果

研究问题

  • RQ1大规模、多模态的食谱与图像数据集是否能够支持训练出在图像-食谱检索任务上达到人类水平性能的深度模型?
  • RQ2在训练目标中加入高层次分类目标是否能提升跨模态嵌入的语义质量和泛化能力?
  • RQ3学习到的嵌入是否能够支持有意义的语义向量算术运算,例如类比推理和食物概念之间的插值?
  • RQ4与先前数据集相比,Recipe1M+ 在数据质量和模型性能方面,其规模和结构有何优势?
  • RQ5学习到的嵌入在多大程度上能够支持新应用,如食谱修改或跨模态生成?

主要发现

  • 在 Recipe1M+ 上训练的模型在图像-食谱检索任务上的性能经 Amazon Mechanical Turk (AMT) 评估,与人类表现相当。
  • 添加高层次分类目标显著提升了检索准确率,并实现了更语义合理的向量算术运算,例如通过替换操作从'tacos'生成'lettuce wraps'。
  • 在 Recipe1M+ 上训练的模型在不同分数阶算术系数下产生明显且可解释的结果,而基线模型在不同系数间表现出有限的差异。
  • 该模型成功地在图像和食谱嵌入空间中对食物概念(如'curry'和'soup')进行插值,生成视觉和语义上连贯的过渡。
  • 扩展后的数据集(Recipe1M+)相比原始 Recipe1M 噪声增加极少,并在 Food-101 基准测试中表现更优,表明其具备强大的泛化能力。
  • 学习到的嵌入支持组合性推理,例如通过向量运算生成新菜肴概念,暗示其在食谱修改和跨模态生成方面具有潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。