[論文レビュー] FooDI-ML: a large multi-language dataset of food, drinks and groceries images and descriptions
本稿では、37か国から33言語にわたり、280万枚の食品・飲料・日用品の画像と950万件のテキスト記述を含む大規模な多言語視覚言語データセットであるFooDI-MLを紹介する。Glovoの6年間の運用から収集されたもので、テキスト-画像検索および条件付き画像生成のベンチマークが可能であり、CLIPは検索タスクでR@10に5.12を達成した。これは、データセットの規模にもかかわらず強いゼロショット一般化性能を示している。
In this paper we introduce the FooDI-ML dataset. This dataset contains over 1.5M unique images and over 9.5M store names, product names descriptions, and collection sections gathered from the Glovo application. The data made available corresponds to food, drinks and groceries products from 37 countries in Europe, the Middle East, Africa and Latin America. The dataset comprehends 33 languages, including 870K samples of languages of countries from Eastern Europe and Western Asia such as Ukrainian and Kazakh, which have been so far underrepresented in publicly available visio-linguistic datasets. The dataset also includes widely spoken languages such as Spanish and English. To assist further research, we include benchmarks over two tasks: text-image retrieval and conditional image generation.
研究の動機と目的
- 食品・飲料・日用品分野における大規模かつ多言語対応の視覚言語データセットの不足を解消すること。
- ウクライナ語やカザフ語のような言語の不足を補い、視覚言語モデルにおけるバイアスを低減すること。
- 37か国・33言語をカバーする公開可能な大規模データセットを提供し、食品・日用品のアイテムに対して豊富なアノテーションを提供すること。
- ドメイン特化された文脈において、テキスト-画像検索や条件付き画像生成といったクロスマodalタスクのベンチマークを可能にすること。
- 食品関連アプリケーション向けの多言語検索エンジンや、改善された画像埋め込みの開発を支援すること。
提案手法
- データセットはGlovoの食品・日用品デリバリー・プラットフォームから6年間の運用データを収集して構築された。
- 280万件のユニークな画像と950万件の自然言語記述(製品名、店名、収集セクションを含む)が含まれる。
- 再現可能なベンチマークを支援するため、トレイン/バリエーション/テストの分割が設定された。
- テキスト-画像検索はR@N指標を用いて評価され、CLIP(ゼロショット)と再実装されたWITモデルの比較がなされた。
- 条件付き画像生成には自己注意GANが用いられ、リアルなピザ画像が生成され、インセプションスコアは3.58となった。
- 最近の文書表現の進展を反映するため、bag-of-wordsではなくトランスフォーマー基盤の文書エンコーダーを用いてWITモデルを再実装した。
実験結果
リサーチクエスチョン
- RQ1大規模かつ多言語対応の食品・日用品データセットにおいて、ゼロショットおよび微調整済みの視覚言語モデルの有効性はいかほどか?
- RQ2ウクライナ語やカザフ語のような言語が、大規模データセットを用いて視覚言語タスクで効果的に活用できるか?
- RQ3特にドメイン特化された文脈において、データセットの規模がテキスト-画像検索の性能にどのように影響するか?
- RQ4条件付き画像生成モデルが、このデータセットを用いてリアルな食品画像をどれほど効果的に生成できるか?
- RQ5CLIPの性能は、この新しい大規模多言語データセットにおいて、再実装されたWITモデルと比べてどの程度優れているか?
主な発見
- CLIPはテキスト-画像検索タスクでR@10に5.12を達成し、同じ指標で4.97を記録した再実装WITモデルを顕著に上回った。
- 再実装WITモデルは画像-テキスト検索タスクでR@10に0.91を記録し、大規模データセット上でも中程度の性能を示した。
- CLIPのゼロショット性能は、同じデータで微調整されたWITモデルよりも顕著に優れており、CLIPの強力な一般化能力を示している。
- 訓練済みGANのインセプションスコアが3.58であったことから、モデルはリアルで多様なピザ画像を生成でき、条件付き生成の有効性が裏付けられた。
- ウクライナ語やカザフ語のような言語で87万件のサンプルを含む本データセットの多言語カバレッジにより、より包括的なモデル学習が可能になった。
- 大規模であるにもかかわらず、検索タスクは依然として挑戦的である—視覚的特徴の重複があるため、正解のマッチがしばしば上位10位以内にランクされなかった。これは、視覚的特徴の重複が検索精度に悪影響を及える可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。