Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Modal Food Retrieval: Learning a Joint Embedding of Food Images and Recipes with Semantic Consistency and Attention Mechanism

Hao Wang, Doyen Sahoo|arXiv (Cornell University)|Mar 9, 2020
Advanced Image and Video Retrieval Techniques参考文献 36被引用数 9
ひとこと要約

本論文は、意味的整合性損失と自己注意メカニズムを用いて、食品画像とレシピの共同埋め込みを学習する新しいフレームワークSCANを提案する。画像とレシピの意味的確率を一致させ、特徴的な材料や調理手順を強調することで、SCANはクラス内分散を顕著に低減し、Recipe1Mデータセット上で最先端の性能を達成し、検索精度を向上させる。

ABSTRACT

Food retrieval is an important task to perform analysis of food-related information, where we are interested in retrieving relevant information about the queried food item such as ingredients, cooking instructions, etc. In this paper, we investigate cross-modal retrieval between food images and cooking recipes. The goal is to learn an embedding of images and recipes in a common feature space, such that the corresponding image-recipe embeddings lie close to one another. Two major challenges in addressing this problem are 1) large intra-variance and small inter-variance across cross-modal food data; and 2) difficulties in obtaining discriminative recipe representations. To address these two problems, we propose Semantic-Consistent and Attention-based Networks (SCAN), which regularize the embeddings of the two modalities through aligning output semantic probabilities. Besides, we exploit a self-attention mechanism to improve the embedding of recipes. We evaluate the performance of the proposed method on the large-scale Recipe1M dataset, and show that we can outperform several state-of-the-art cross-modal retrieval strategies for food images and cooking recipes by a significant margin.

研究の動機と目的

  • 画像とレシピ間のクロスモーダル食品検索における大きなクラス内分散と小さなクラス間分散の課題に対処すること。
  • ノイズが多いまたは一般的な材料や手順が存在する状況下でも、レシピの判別的表現学習を向上させること。
  • 効果的なレシピ埋め込みのための画像品質や高品質な視覚データへの依存を低減すること。
  • 画像とレシピの埋め込みを共通の特徴空間で強化する統合フレームワークを構築すること。
  • Recipe1Mのような大規模で現実世界の食品データセットにおいて、優れた検索性能を達成すること。

提案手法

  • ペアドされた画像とレシピ埋め込みの出力意味的確率分布を一致させるために、Kullback-Leibler(KL)ダイバージェンスに基づく意味的整合性損失を導入する。
  • LSTMで符号化されたレシピ特徴に対して自己注意メカニズムを適用し、重要な材料や調理手順を特定・強調することで、表現を向上させる。
  • 正例と負例のクロスモーダルペア間のマージンベースのランク付けを強制するために、トリプレット損失の目的関数を用いてモデルを訓練する。
  • 自己注意メカニズムとLSTMを組み合わせることで、視覚入力なしにより判別力のあるレシピ埋め込みを生成する。
  • t-SNE可視化とクラス内距離分析を用いて、意味的整合性損失が特徴の分散を低減する有効性を検証する。
  • End-to-endでRecipe1Mデータセットにフレームワークを適用し、レシピから画像への検索と画像からレシピへの検索を両方可能にする。

実験結果

リサーチクエスチョン

  • RQ1意味的整合性損失は、画像とレシピの意味的確率を一致させることで、クロスモーダル食品検索におけるクラス内分散を効果的に低減できるか?
  • RQ2視覚データが欠如している状況下で、LSTMに自己注意を統合することで、レシピ埋め込みの判別力がどの程度向上するか?
  • RQ3提案されたSCANフレームワークは、vanillaトリプレット損失のようなベースライン手法と比較して、検索ランク精度においてどのように差がつくか?
  • RQ4低品質またはノイズの多い食品画像においても、自己注意メカニズムは頑健に機能するか?
  • RQ5共通の材料を共有する複雑で類似したレシピに対して、キーポイントとなる区別のつく成分に注目することで、モデルは一般化可能か?

主な発見

  • SCANはRecipe1Mデータセット上で、複数の最先端のクロスモーダル検索手法を上回り、レシピから画像への検索および画像からレシピへの検索の両タスクで最高のパフォーマンスを達成した。
  • 意味的整合性損失により、ペアドされた画像とレシピ埋め込み間の平均クラス内特徴距離が顕著に低減されていることが、t-SNE可視化とチョコレートチップレシピに関する定量的分析で示された。
  • 自己注意メカニズムは、画像に存在しないか曖昧な場合でも、『frozen whipped topping』のような重要な材料や手順を効果的に特定・強調する。
  • 意味的整合性損失のみ(TL+SC)または自己注意のみ(TL+SA)で訓練されたモデルは、劣った結果を示すため、両者の組み合わせが最適なパフォーマンスを達成するために不可欠であることが示された。
  • 注目メカニズムは、低品質な食品画像に対しても効果を発揮し、視覚的ノイズや変動に対して頑健であることが示された。
  • アブレーションスタディにより、意味的整合性損失と自己注意メカニズムが、独立してかつ相乗的に検索精度の向上に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。