Skip to main content
QUICK REVIEW

[論文レビュー] Recipe1M+: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images

Javier Marín, Aritro Biswas|arXiv (Cornell University)|Oct 14, 2018
Nutritional Studies and Diet被引用数 14
ひとこと要約

Recipe1M+ は、100万件以上の料理レシピと1300万枚の料理画像を含む大規模で構造化されたデータセットを提供し、レシピと画像のための統合的クロスマodal埋め込みを学習するための深層ニューラルネットワークの訓練を可能にする。高水準分類目的による意味的正則化を施すことで、画像-レシピ検索において人間並みの性能を達成するとともに、『タコス』から『レタス』に概念を置き換えることで『レタスラップ』を生成するなど、意味的なベクトル演算が可能になる。

ABSTRACT

In this paper, we introduce Recipe1M+, a new large-scale, structured corpus of over one million cooking recipes and 13 million food images. As the largest publicly available collection of recipe data, Recipe1M+ affords the ability to train high-capacity modelson aligned, multimodal data. Using these data, we train a neural network to learn a joint embedding of recipes and images that yields impressive results on an image-recipe retrieval task. Moreover, we demonstrate that regularization via the addition of a high-level classification objective both improves retrieval performance to rival that of humans and enables semantic vector arithmetic. We postulate that these embeddings will provide a basis for further exploration of the Recipe1M+ dataset and food and cooking in general. Code, data and models are publicly available.

研究の動機と目的

  • 料理レシピと料理画像のための統合的表現を学習するための大規模でマルチモーダルなデータセットの不足に対処すること。
  • 構造化されたアライメント済みのレシピおよび画像データを用いた高容量モデルの訓練を可能にし、クロスマodal理解を向上させること。
  • 上位レベルの分類タスクによる意味的正則化を受ける埋め込みを学習するニューラルモデルの開発。これは、意味的演算や検索といった高度なタスクを支援できるようにすることを目的とする。
  • 高水準分類タスクを訓練目的に組み込むことで、埋め込み空間における検索精度と意味的合成性が向上することを示すこと。
  • 研究の前進を図るため、コード、データ、モデルを含む公開リソースを提供すること。

提案手法

  • 著者らは、オンラインソースから収集した100万件のレシピと1300万枚の料理画像を含み、材料、手順、画像メタデータの構造化されたアノテーションを備えた、Recipe1M+ と呼ばれるデータセットを構築した。
  • 対照的学習目的を用いて、テキスト(レシピ)と画像を共通の意味的空間に統合的に埋め込むマルチモーダルニューラルネットワークを訓練した。
  • 埋め込み空間の意味的整合性と一般化性能を向上させるために、モデルに高水準分類ヘッドを追加し、正則化を施した。
  • クロスマodalアライメントのための対照損失と、高水準の料理カテゴリ予測のための交差エントロピー損失の両方を組み合わせて、モデルをファインチューニングした。
  • 意味的ベクトル演算は、埋め込み空間内のベクトル表現を操作することで実行され、類推的推論(例:'タコス' - 'タコスの皮' + 'レタス' → 'レタスラップ')などが可能になる。
  • 分数演算は、2つの概念ベクトルの間を補間することで実行され(例:'ボルティージョ' × x + 'サンドイッチ' × (1−x))、レシピおよび画像空間における連続的変化を探索する。

実験結果

リサーチクエスチョン

  • RQ1大規模でマルチモーダルなレシピと画像のデータセットは、画像-レシピ検索タスクで人間並みの性能を達成する深層モデルの訓練を可能にするか?
  • RQ2訓練目的に高水準分類タスクを追加することで、クロスマodal埋め込みの意味的品質と一般化性能が向上するか?
  • RQ3学習された埋め込みは、類推的推論や食品概念間の補間といった意味的ベクトル演算を意味的に意味のある形でサポートできるか?
  • RQ4データ品質とモデル性能の観点から、Recipe1M+ のスケールと構造は、先行するデータセットと比較してどの程度優れているか?
  • RQ5学習された埋め込みは、レシピの変更やクロスマodal生成といった新規応用をどの程度サポートできるか?

主な発見

  • Recipe1M+ で訓練されたモデルは、アマゾンMechanical Turk(AMT)による評価を通じて、画像-レシピ検索タスクで人間の性能と同等の結果を達成した。
  • 高水準分類タスクの追加により、検索精度が顕著に向上し、『タコス』から『レタス』に置き換えることで『レタスラップ』を生成するなど、より意味的に整合性のあるベクトル演算が可能になった。
  • Recipe1M+ で訓練されたモデルは、分数演算の係数に対して明確に異なるかつ解釈可能な結果を生成したのに対し、ベースラインモデルでは係数間の変動が限定的で、差がほとんど見られなかった。
  • モデルは、画像およびレシピ埋め込み空間の両方で、『カレー』と『スープ』といった食品概念の間を滑らかに補間でき、視覚的および意味的に整合性のある変化を生み出した。
  • 拡張されたデータセット(Recipe1M+)は、元のRecipe1Mと比較してノイズの増加が最小限に抑えられ、Food-101ベンチマークでも性能が向上した。これは、強力な一般化能力を示している。
  • 学習された埋め込みは、ベクトル演算による合成的推論をサポートしており、たとえばベクトル演算によって新しい料理概念を生成できる。これは、レシピの変更やクロスマodal生成への応用可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。