Skip to main content
QUICK REVIEW

[论文解读] Dividing and Conquering Cross-Modal Recipe Retrieval: from Nearest Neighbours Baselines to SoTA

Mikhail Fain, Twomey, Niall|arXiv (Cornell University)|Nov 28, 2019
Topic Modeling参考文献 56被引用 15
一句话总结

本文提出跨模态k近邻(CkNN),一种简单而强大的非参数化方法,用于跨模态食谱检索,利用预计算的图像和文本嵌入。通过在自监督图像和文本编码器上应用CkNN,该方法在Recipe1M数据集上实现了最先进性能(Recall@1为64.8%),并有效泛化至Politics和GoodNews数据集,以极低的复杂度超越了先前方法,且无需端到端训练。

ABSTRACT

We propose a novel non-parametric method for cross-modal recipe retrieval which is applied on top of precomputed image and text embeddings. By combining our method with standard approaches for building image and text encoders, trained independently with a self-supervised classification objective, we create a baseline model which outperforms most existing methods on a challenging image-to-recipe task. We also use our method for comparing image and text encoders trained using different modern approaches, thus addressing the issues hindering the development of novel methods for cross-modal recipe retrieval. We demonstrate how to use the insights from model comparison and extend our baseline model with standard triplet loss that improves state-of-the-art on the Recipe1M dataset by a large margin, while using only precomputed features and with much less complexity than existing methods. Further, our approach readily generalizes beyond recipe retrieval to other challenging domains, achieving state-of-the-art performance on Politics and GoodNews cross-modal retrieval tasks.

研究动机与目标

  • 为解决跨模态食谱检索中缺乏强大且简洁基线的问题,特别是针对图像到文本匹配任务。
  • 实现不同方法间个体模型组件(尤其是图像和文本编码器)的公平比较。
  • 建立一种系统性框架,用于识别编码器的优势与不足,而无需依赖复杂的端到端架构。
  • 仅使用预计算特征和极少的架构修改,在Recipe1M上实现最先进性能。
  • 证明该方法在食谱检索之外的其他具有挑战性的跨模态检索任务中的泛化能力。

提出的方法

  • CkNN通过在嵌入空间中测量模态间距离,利用k近邻检索给定图像对应的匹配文本。
  • 该方法在独立训练的图像和文本编码器上运行,这些编码器通过自监督对比目标进行优化,而非端到端训练。
  • 基于预计算的图像和文本嵌入之间的余弦相似度执行基于距离的检索。
  • 通过在相同CkNN框架下评估不同编码器(如ResNet、AWE-Encoder),实现模型比较,从而隔离出组件级别的性能表现。
  • 通过在预计算嵌入上应用标准三元组损失,提升基线性能,增强对齐效果,而无需重新训练编码器。
  • 通过复用相同的超参数和CkNN推理流程,该方法可泛化至Politics和GoodNews等其他数据集。

实验结果

研究问题

  • RQ1基于预计算嵌入的简单k近邻检索方法能否作为跨模态食谱检索的强而有竞争力的基线?
  • RQ2CkNN在多大程度上能够实现不同模型间图像和文本编码器组件的公平且系统化的比较?
  • RQ3通过编码器比较获得的洞察能否在不进行端到端训练或复杂架构的情况下,显著提升Recipe1M上的性能?
  • RQ4所提出的方法是否能有效泛化至食谱检索之外的其他跨模态检索基准?
  • RQ5CkNN在Politics和GoodNews等多样化数据集上的性能与最先进方法相比如何?

主要发现

  • 在Politics数据集的图像到文本任务中,CkNN实现了64.8%的Recall@1,与最佳已发表结果持平。
  • 在GoodNews数据集中,CkNN实现了88.6%的Recall@1,达到最先进性能。
  • 通过在预计算特征上应用三元组损失,CkNN将Recipe1M上的最先进性能提升至64.8% Recall@1,显著优于先前最先进方法。
  • 仅使用基线CkNN模型即可在所有三个数据集上实现具有竞争力的性能,且无需任何端到端训练或模型特定调优。
  • 该框架能够清晰地将性能提升归因于特定编码器组件,简化了消融实验与模型分析。
  • 该方法在不同领域间泛化良好,使用相同超参数在食谱和非食谱跨模态检索任务中均表现出色。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。