Skip to main content
QUICK REVIEW

[論文レビュー] The Art of Food: Meal Image Synthesis from Ingredients

Fangda Han, Ricardo Guerrero|arXiv (Cornell University)|May 9, 2019
Generative Adversarial Networks and Image Synthesis参考文献 25被引用数 4
ひとこと要約

本稿では、注釈ベースの材料-画像関連モデルとStackGAN-v2、およびサイクル整合性正則化を組み合わせることで、テキストによる材料記述から写真のようにリアルな料理画像を合成する新規な生成モデルを提案する。本手法は、画像品質および検索精度において最先端の性能を達成し、学習された埋め込みによって材料と視覚的外観を効果的に分離していることを示している。

ABSTRACT

In this work we propose a new computational framework, based on generative deep models, for synthesis of photo-realistic food meal images from textual descriptions of its ingredients. Previous works on synthesis of images from text typically rely on pre-trained text models to extract text features, followed by a generative neural networks (GANs) aimed to generate realistic images conditioned on the text features. These works mainly focus on generating spatially compact and well-defined categories of objects, such as birds or flowers. In contrast, meal images are significantly more complex, consisting of multiple ingredients whose appearance and spatial qualities are further modified by cooking methods. We propose a method that first builds an attention-based ingredients-image association model, which is then used to condition a generative neural network tasked with synthesizing meal images. Furthermore, a cycle-consistent constraint is added to further improve image quality and control appearance. Extensive experiments show our model is able to generate meal image corresponding to the ingredients, which could be used to augment existing dataset for solving other computational food analysis problems.

研究の動機と目的

  • 調理による材料の外観変化や一部の材料の視覚的消失の影響を受ける複雑さがあるにもかかわらず、材料リストから現実的で多様な料理画像を生成する課題に対処すること。
  • 画像品質を向上させるとともに、視点や照明などの不要要因から材料固有の視覚的特徴を分離すること。
  • 制御された材料構成を持つ現実的な合成料理画像を生成することで、計算的食事分析のためのデータ拡張を可能にすること。
  • 材料の集合とそれらが調理された料理の視覚的外観との間の複雑で非線形な関係をモデル化すること。

提案手法

  • 注釈ベースのレシピ関連モデルを訓練し、材料記述を共通の埋め込み空間(FoodSpace)内の画像特徴にマッピングすることで、材料とその視覚的外観の関連を学習する。
  • 生成器としてStackGAN-v2を用い、注釈モデルから抽出した材料特徴を条件として、ランダムノイズと材料埋め込みから画像を合成する。
  • 生成画像を再び材料空間にエンコードすることで、サイクル整合性正則化を導入し、再構築された材料が元の入力材料と一致することを強制する。
  • 画像エンコーダーを生成器で再利用することで、画像生成と再構成のパス間で一貫した特徴表現を確保する。
  • 一般化性と分離性の向上を図るため、材料を標準化された語彙に変換する処理を実施する。
  • FoodSpaceにおける線形補間を用いて、材料の追加または削除に伴う画像外観の徐々な変化を可視化する。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、視覚的外観と空間的配置を捉えたまま、材料リストのみに条件付けられた写真のようにリアルな料理画像を合成できるか?
  • RQ2生成画像において、視点や照明などの不要要因から材料固有の視覚的特徴をどのように分離できるか?
  • RQ3サイクル整合性正則化は、生成された料理画像の品質と忠実度をどの程度向上させるか?
  • RQ4材料が最終画像に視覚的に不明瞭または存在しない場合(例:塩、油)でも、入力された材料と意味的に整合した画像を生成できるか?

主な発見

  • 本モデルはマフィンサブセットでFID 81.13を達成し、StackGAN-v2のFID 104.73を上回り、画像品質に優れていることが示された。
  • サラダサブセットでは、本モデルがInception Score 66.15を達成したのに対し、StackGAN-v2は58.40であった。これは、生成画像の多様性と品質に優れていることを示している。
  • 合成画像を用いたレシピ検索における中央順位(MedR)は、本モデルが(クッキーでは103.3)StackGAN-v2(217.5)よりも顕著に低く、意味的整合性に優れていることを示している。
  • FoodSpaceにおける線形補間により、ターゲット材料(例:トマト、ブルーベリー)の徐々な除去が効果的に可視化され、モデルが潜在空間を通じて外観を制御できることを確認した。
  • 同じランダムベクトルだが異なる材料を用いた生成画像では、視点や照明が一貫しており、同じ材料だが異なるランダムベクトルを用いた画像では視点が変化していることから、コンテンツとスタイルの分離が確認された。
  • 材料を標準語彙に変換する処理が、効果的な画像合成と分離に不可欠であることがモデルによって示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。