[论文解读] Cross-Modal Food Retrieval: Learning a Joint Embedding of Food Images and Recipes with Semantic Consistency and Attention Mechanism
本文提出SCAN,一种用于跨模态食物检索的新框架,通过语义一致性损失和自注意力机制,学习食物图像与食谱的联合嵌入。通过对齐图像与食谱的语义概率分布并突出显示具有区分性的食材与步骤,SCAN显著降低了类内方差,并在Recipe1M数据集上实现了最先进性能,提升了检索准确率。
Food retrieval is an important task to perform analysis of food-related information, where we are interested in retrieving relevant information about the queried food item such as ingredients, cooking instructions, etc. In this paper, we investigate cross-modal retrieval between food images and cooking recipes. The goal is to learn an embedding of images and recipes in a common feature space, such that the corresponding image-recipe embeddings lie close to one another. Two major challenges in addressing this problem are 1) large intra-variance and small inter-variance across cross-modal food data; and 2) difficulties in obtaining discriminative recipe representations. To address these two problems, we propose Semantic-Consistent and Attention-based Networks (SCAN), which regularize the embeddings of the two modalities through aligning output semantic probabilities. Besides, we exploit a self-attention mechanism to improve the embedding of recipes. We evaluate the performance of the proposed method on the large-scale Recipe1M dataset, and show that we can outperform several state-of-the-art cross-modal retrieval strategies for food images and cooking recipes by a significant margin.
研究动机与目标
- 解决图像与食谱之间跨模态食物检索中的大类内方差与小类间方差挑战。
- 在存在噪声或常见食材与步骤的情况下,提升食谱的判别性表征学习能力。
- 降低对图像质量与高质量视觉数据的依赖,以实现有效的食谱嵌入。
- 开发一个统一框架,增强共享特征空间中图像与食谱嵌入之间的对齐。
- 在大规模真实世界食物数据集(如Recipe1M)上实现卓越的检索性能。
提出的方法
- 基于Kullback-Leibler(KL)散度提出一种语义一致性损失,用于对齐配对图像与食谱嵌入的输出语义概率分布。
- 在LSTM编码的食谱特征上应用自注意力机制,以识别并强调关键食材与烹饪步骤,从而改善表征。
- 使用三元组损失目标进行模型训练,以在正样本与负样本跨模态对之间施加基于边距的排序。
- 将自注意力机制与LSTM结合,生成更具判别性的食谱嵌入,且无需视觉输入。
- 通过t-SNE可视化与类内距离分析,验证语义一致性损失在降低特征方差方面的有效性。
- 在Recipe1M数据集上端到端应用该框架,支持食谱到图像与图像到食谱的检索。
实验结果
研究问题
- RQ1语义一致性损失是否能通过对齐图像与食谱的语义概率分布,有效降低跨模态食物检索中的类内方差?
- RQ2在缺乏视觉数据的情况下,将自注意力机制与LSTM结合,能在多大程度上提升食谱嵌入的判别能力?
- RQ3与基线方法(如普通三元组损失)相比,所提出的SCAN框架在检索排序准确率方面表现如何?
- RQ4在检索过程中,自注意力机制是否对低质量或噪声食物图像保持鲁棒性?
- RQ5通过聚焦于关键区分性成分,模型能否在具有共享食材的复杂相似食谱上实现良好泛化?
主要发现
- SCAN在Recipe1M数据集上优于多种最先进跨模态检索方法,在食谱到图像与图像到食谱检索任务中均取得最佳性能。
- 语义一致性损失显著降低了配对图像与食谱嵌入之间的平均类内特征距离,t-SNE可视化与巧克力曲奇食谱的定量分析均证实了这一点。
- 自注意力机制能有效识别并突出显示关键食材与步骤(如食谱中的“冷冻鲜奶油 topping”),即使这些内容在图像中缺失或模糊。
- 仅使用语义一致性损失(TL+SC)或仅使用自注意力(TL+SA)训练的模型表现欠佳,表明两者结合对最优性能至关重要。
- 即使在低质量食物图像上,注意力机制仍保持有效性,表明其对视觉噪声与变化具有鲁棒性。
- 消融研究证实,语义一致性损失与自注意力机制均独立且协同地促进了检索准确率的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。