Skip to main content
QUICK REVIEW

[论文解读] Learning Structural Representations for Recipe Generation and Food Retrieval

Hao Wang, Guosheng Lin|arXiv (Cornell University)|Oct 4, 2021
Multimodal Machine Learning Applications被引用 4
一句话总结

该论文提出了一种无监督方法,用于学习长篇烹饪食谱的句子级树状结构,从而提升食谱生成与食物跨模态检索的性能。通过将ON-LSTM扩展以支持Quick Thoughts的无监督树结构标注,并结合图注意力网络(GAT)编码这些结构,该模型在Recipe1M基准上实现了生成连贯性和性能的提升,两项任务均达到当前最优结果。

ABSTRACT

Food is significant to human daily life. In this paper, we are interested in learning structural representations for lengthy recipes, that can benefit the recipe generation and food cross-modal retrieval tasks. Different from the common vision-language data, here the food images contain mixed ingredients and target recipes are lengthy paragraphs, where we do not have annotations on structure information. To address the above limitations, we propose a novel method to unsupervisedly learn the sentence-level tree structures for the cooking recipes. Our approach brings together several novel ideas in a systematic framework: (1) exploiting an unsupervised learning approach to obtain the sentence-level tree structure labels before training; (2) generating trees of target recipes from images with the supervision of tree structure labels learned from (1); and (3) integrating the learned tree structures into the recipe generation and food cross-modal retrieval procedure. Our proposed model can produce good-quality sentence-level tree structures and coherent recipes. We achieve the state-of-the-art recipe generation and food cross-modal retrieval performance on the benchmark Recipe1M dataset.

研究动机与目标

  • 为解决食物图像-文本数据集中缺乏结构化标注的问题,其中食谱为长段落且成分混杂,导致传统视觉-语言方法效果减弱。
  • 在无需人工结构标注的情况下,无监督地学习食谱的句子级树状结构。
  • 通过在文本生成过程中引入学习到的树状结构作为结构引导,提升食谱生成的质量。
  • 通过将树状结构表示融合到食谱特征中,提升食物跨模态检索性能,实现与图像更优的匹配。
  • 证明无监督结构学习可显著提升食谱生成与跨模态检索任务的性能。

提出的方法

  • 提出一种基于扩展ON-LSTM架构的新型recipe2tree模块,无监督地从食谱文本中生成句子级树状结构。
  • 使用Quick Thoughts训练目标预训练ON-LSTM变体,使其在无监督条件下学习层次化句子结构。
  • 设计一种结构感知的生成网络(SGN),利用img2tree模块从食物图像特征中预测食谱树状结构。
  • 采用图注意力网络(GAT)将预测的树状结构编码为上下文嵌入,用于生成与检索任务。
  • 将树状结构嵌入集成到食谱生成解码器中,以引导生成连贯的长篇食谱。
  • 通过将树状结构特征与原始食谱嵌入融合,提升跨模态检索性能,改善图像与食谱的匹配效果。

实验结果

研究问题

  • RQ1无监督学习句子级树状结构是否能提升生成食谱的连贯性与质量?
  • RQ2从食谱中提取的结构化表示能否提升食物图像与长篇烹饪说明之间的跨模态检索性能?
  • RQ3当缺乏真实结构标注时,所提出的无监督树状结构学习方法效果如何?
  • RQ4与基线模型相比,树状结构嵌入在生成与检索任务中的提升程度如何?
  • RQ5该模型能否在多种食物类别上实现泛化,并基于图像输入生成结构连贯的食谱?

主要发现

  • 所提出的SGN模型在食谱生成任务上达到最先进性能,在Recipe1M基准上的自动评估与人工评估指标均优于现有方法。
  • 将树状结构嵌入集成到跨模态检索中,显著提升了检索准确率,top-10召回率与mAP得分均超过先前基线。
  • 定性分析表明,生成的食谱树状结构在语义上连贯,且在结构上与真实树状结构相似,尽管未对结构进行任何监督。
  • 该模型能成功为多样化的食物图像检索相关食谱,包括如鸡肉威灵顿与土豆蛋糕等复杂菜肴,展示了强大的跨模态对齐能力。
  • img2tree模块能从图像特征生成多样但合理的树状结构,有效引导生成更长、更连贯的食谱。
  • 无监督树状结构学习方法能有效捕捉烹饪过程的顺序性与层次性,即使在无显式结构标注的情况下亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。