Skip to main content
QUICK REVIEW

[論文レビュー] GILT: Generating Images from Long Text

Ori Bar El, Ori Licht|arXiv (Cornell University)|Jan 8, 2019
Image Retrieval and Classification Techniques参考文献 17被引用数 10
ひとこと要約

この論文は、フルレシピなどの長く複雑なテキスト記述(視覚的記述なし)から高解像度(256×256)の料理画像を生成するための新規タスクおよびベースラインであるGILTを紹介する。手法は、2種類のレシピ埋め込みタイプ—コサイン類似度に基づく(NOREG)と意味的正則化付き(REG)—を条件とするStackGAN-v2を使用し、REGは分類タスクで優れた性能を示すが、NOREGはより多様で写真のようにリアルな画像を生成するという結果を得た。

ABSTRACT

Creating an image reflecting the content of a long text is a complex process that requires a sense of creativity. For example, creating a book cover or a movie poster based on their summary or a food image based on its recipe. In this paper we present the new task of generating images from long text that does not describe the visual content of the image directly. For this, we build a system for generating high-resolution 256 $ imes$ 256 images of food conditioned on their recipes. The relation between the recipe text (without its title) to the visual content of the image is vague, and the textual structure of recipes is complex, consisting of two sections (ingredients and instructions) both containing multiple sentences. We used the recipe1M dataset to train and evaluate our model that is based on a the StackGAN-v2 architecture.

研究の動機と目的

  • 長大で視覚的記述のないテキスト記述(例:フルレシピ)から高解像度画像を生成する新しいタスクを確立すること。
  • 材料と手順の2つのセクションを含む複雑なレシピを条件とする画像生成のベースラインシステムを、条件付きGANを用いて開発すること。
  • テキストから画像への生成の文脈において、意味的正則化なし(NOREG)とあり(REG)の2種類のレシピ埋め込み手法を比較すること。
  • 画像の品質および多様性を、定量的指標(Inceptionスコア、MS-SSIM)と人間評価(画像のリアルさ、レシピとの関連性、視覚的妥当性)の両方を用いて評価すること。

提案手法

  • モデルは、低解像度のノイズベクトルから始まり、複数段階の生成器および識別器ステージを経て256×256の画像を生成するマルチステージプロセスを用いるStackGAN-v2を採用する。
  • 生成器および識別器は、レシピのタイトルを除く全レシピを表す1つの埋め込みベクトルに条件付けられる。この埋め込みベクトルは、レシピと画像の埋め込み間のコサイン類似度損失を用いて学習された共同埋め込み空間から得られる。
  • 2種類の埋め込み手法を用いる:NOREGは、レシピと画像の埋め込み間のコサイン類似度に基づくのみ。REGは、埋め込み空間を正則化する高レベル分類損失を追加する。
  • レシピ埋め込みは2段階のプロセスで計算される:まず材料と手順のための初期埋め込みが学習され、その後それらが画像と共有された意味的空間で連結・統合される。
  • 学習目的は標準のミニマックスGAN損失に従い、条件付きGANの定式化を採用する:min_G max_D E[log D(x)] + E[log(1 - D(G(z,c)))] ここでcはレシピ埋め込みを表す。
  • 評価には、多様性評価のためのInceptionスコアおよびMS-SSIM、および3つの側面(レシピとの関連性、画像のリアルさ、画像とレシピの一貫性)における人間評価が含まれる。

実験結果

リサーチクエスチョン

  • RQ1条件付きGANは、フルレシピなどの長大で視覚的記述のないテキスト記述から高解像度で写真のようにリアルな料理画像を生成できるか?
  • RQ2意味的正則化あり/なしの異なるレシピ埋め込み戦略が、テキストから画像への生成における画像品質および多様性にどのように影響するか?
  • RQ3recipe1Mのような低品質で多様性の高いデータセットで学習したモデルでも、画像ノイズや照明の悪さがある中で、依然としてリアルで多様な出力を生成できるか?
  • RQ4分類タスク(例:1048種類の料理クラス)におけるレシピ埋め込み手法の性能は、画像生成タスクにおける成功を予測できるか?
  • RQ5人間による画像のリアルさおよびレシピ関連性の判断と、InceptionスコアやMS-SSIMのような自動指標との相関はどの程度か?

主な発見

  • NOREG埋め込み手法(意味的正則化なし)は、REG(4.42 ± 0.17)よりも高いInceptionスコア(4.55 ± 0.20)を達成し、画像品質および多様性が優れていることを示した。
  • 人間評価では、NOREGがリアルさ(3.72)およびレシピとの関連性(2.88)において、REG(3.05および2.62)を有意に上回った。
  • MS-SSIMスコアは、NOREGがREG(0.17)よりも低いスコア(0.07)を示し、より多様な画像を生成したことを確認した。低スコアが多様性の高い出力を示す。
  • REGは元の分類タスクで優れた性能を示した([11]で報告済み)が、画像生成タスクでは劣り、ぼやけた、リアルでない出力を生成した。
  • スープ、ご飯、パスタなどのペースト状の料理(例:お粥)の画像は、リアルに生成されたが、ハンバーガーやドリンクなど形状が明確な料理では苦戦した。これは、学習データセット内の画像品質が低かったことが原因とされる。
  • 一部のケースでは、生成画像が人間評価で実画像を上回るスコアを獲得した。これは、モデルが妥当でリアルな出力を生成できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。