Skip to main content
QUICK REVIEW

[论文解读] FooDI-ML: a large multi-language dataset of food, drinks and groceries images and descriptions

David Amat Olóndriz, Ponç Palau Puigdevall|arXiv (Cornell University)|Oct 5, 2021
Image Retrieval and Classification Techniques被引用 5
一句话总结

本文介绍了 FooDI-ML,这是一个大规模多语言视觉-语言数据集,包含 280 万张食品、饮品和杂货图像,以及来自 37 个国家的 33 种语言的 950 万条文本描述。该数据集源自 Glovo 六年运营的积累,可用于文本-图像检索和条件图像生成的基准测试,CLIP 在检索任务中达到 5.12 的 R@10 分数,表明尽管数据集规模庞大,仍展现出强大的零样本泛化能力。

ABSTRACT

In this paper we introduce the FooDI-ML dataset. This dataset contains over 1.5M unique images and over 9.5M store names, product names descriptions, and collection sections gathered from the Glovo application. The data made available corresponds to food, drinks and groceries products from 37 countries in Europe, the Middle East, Africa and Latin America. The dataset comprehends 33 languages, including 870K samples of languages of countries from Eastern Europe and Western Asia such as Ukrainian and Kazakh, which have been so far underrepresented in publicly available visio-linguistic datasets. The dataset also includes widely spoken languages such as Spanish and English. To assist further research, we include benchmarks over two tasks: text-image retrieval and conditional image generation.

研究动机与目标

  • 为食品、饮品和杂货领域解决缺乏大规模多语言视觉-语言数据集的问题。
  • 通过包含乌克兰语和哈萨克语等代表性不足的语言,减少视觉-语言模型中的偏差。
  • 提供一个公开可用的大规模数据集,覆盖 37 个国家和 33 种语言,对食品和杂货项目提供丰富的标注。
  • 在特定领域背景下,支持跨模态任务(如文本-图像检索和条件图像生成)的基准测试。
  • 支持多语言搜索引擎和食品相关应用中更优图像嵌入的开发。

提出的方法

  • 该数据集从 Glovo 的食品和杂货配送平台收集,涵盖六年的运营数据。
  • 包含 280 万张唯一图像,配以 950 万条自然语言描述,包括产品名称、店铺名称和取货区域。
  • 建立了训练/验证/测试划分,以支持可复现的基准测试。
  • 使用 R@N 指标评估文本-图像检索,比较 CLIP(零样本)和重新实现的 WIT 模型。
  • 使用自注意力生成对抗网络(Self-Attention GAN)进行条件图像生成,生成逼真的披萨图像,其 Inception 分数为 3.58。
  • 采用基于 Transformer 的句子编码器替代词袋模型,重新实现 WIT 模型,以反映近期句子编码技术的进展。

实验结果

研究问题

  • RQ1在大规模多语言食品和杂货数据集上,零样本和微调后的视觉-语言模型效果如何?
  • RQ2在大规模数据集上,代表性不足的语言(如乌克兰语和哈萨克语)能否在视觉-语言任务中有效利用?
  • RQ3在特定领域背景下,文本-图像检索的性能如何随数据集规模扩大而变化?
  • RQ4条件图像生成模型在多大程度上能利用该数据集生成逼真的食品图像?
  • RQ5在这一新型大规模多语言数据集上,CLIP 的性能与重新实现的 WIT 模型相比如何?

主要发现

  • CLIP 在文本到图像检索任务中取得 5.12 的 R@10 分数,显著优于重新实现的 WIT 模型在相同指标下的 4.97 分数。
  • WIT 模型在图像到文本检索任务中取得 0.91 的 R@10 分数,表明其在大规模数据集上表现中等。
  • CLIP 在 FooDI-ML 上的零样本性能显著优于在相同数据上微调的 WIT 模型,凸显了 CLIP 强大的泛化能力。
  • 训练生成对抗网络的 Inception 分数为 3.58,表明模型能生成逼真且多样化的披萨图像,验证了其在条件生成任务中的有效性。
  • 该数据集的多语言覆盖范围广,包括 87 万条代表性不足语言(如乌克兰语和哈萨克语)的样本,有助于实现更包容的模型训练。
  • 尽管数据集规模庞大,检索任务仍具挑战性——正确匹配项常被排在前十名之外,如具有重叠视觉特征的定性示例所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。