Skip to main content
QUICK REVIEW

[論文レビュー] Realistic Image Generation using Region-phrase Attention

Wanming Huang, Yida Xu|arXiv (Cornell University)|Feb 4, 2019
Generative Adversarial Networks and Image Synthesis参考文献 19被引用数 9
ひとこと要約

本稿では、テキストから画像を生成するGANにおける領域フレーズ注意機構を提案し、個々の語ではなく、『赤いシャツ』のような記述的フレーズを真のグリッド領域と一致させることで、画像のリアルさを向上させている。補助的なバウンディングボックスと品詞解析から得られるフレーズレベルの埋め込みを用いることで、モデルはより正確で多様性に富み、文脈的に整合性のある画像を生成し、MSCOCO上でのAttnGANと比較してR-precisionが向上し、物体数の正確性も向上させた。

ABSTRACT

The Generative Adversarial Network (GAN) has recently been applied to generate synthetic images from text. Despite significant advances, most current state-of-the-art algorithms are regular-grid region based; when attention is used, it is mainly applied between individual regular-grid regions and a word. These approaches are sufficient to generate images that contain a single object in its foreground, such as a "bird" or "flower". However, natural languages often involve complex foreground objects and the background may also constitute a variable portion of the generated image. Therefore, the regular-grid based image attention weights may not necessarily concentrate on the intended foreground region(s), which in turn, results in an unnatural looking image. Additionally, individual words such as "a", "blue" and "shirt" do not necessarily provide a full visual context unless they are applied together. For this reason, in our paper, we proposed a novel method in which we introduced an additional set of attentions between true-grid regions and word phrases. The true-grid region is derived using a set of auxiliary bounding boxes. These auxiliary bounding boxes serve as superior location indicators to where the alignment and attention should be drawn with the word phrases. Word phrases are derived from analysing Part-of-Speech (POS) results. We perform experiments on this novel network architecture using the Microsoft Common Objects in Context (MSCOCO) dataset and the model generates $256 imes 256$ conditioned on a short sentence description. Our proposed approach is capable of generating more realistic images compared with the current state-of-the-art algorithms.

研究の動機と目的

  • 既存のGANが複雑な前景・背景の相互作用を持つ複数の物体を含むリアルな画像を生成する能力に制限を抱えているのを是正すること。
  • 語のレベルの注意をフレーズのレベルの注意に置き換えることで、テキストと画像領域間の注意の一致を改善すること。
  • 補助的なバウンディングボックスによって定義される真のグリッド領域を組み込むことで、画像生成の忠実度を向上させること。
  • 『緑のリンゴ』のようなフレーズの完全な視覚的文脈を、孤立した語ではなく捉えること。
  • 単一のキーワードに偏った生成バイアスを低減し、意味的に類似した文の間で一貫性を高めること。

提案手法

  • 補助的なバウンディングボックスによって定義される真のグリッド画像領域と、品詞(POS)解析から得られる複数語のフレーズとの間で注意を計算する、新しい注意機構を提案する。
  • 連続する語のシーケンスからのフレーズ埋め込みを導入し、個々の語を超えた意味的文脈を捉える。
  • DAMSM損失関数を変更し、バウンディングボックス内でのフレーズレベルの埋め込みと真のグリッド特徴量を統合することで、画像と文の一致をより良くする。
  • 1層のニューラルネットワークを用いてバウンディングボックスと物体数の予測を実施し、深層構造よりも優れた性能を示した。
  • StackGANに類似した2段階のGANフレームワークを採用し、フレーズと画像領域の間で特徴量レベルでの注意を適用する。
  • MSCOCOデータセット上で、文全体の文と画像の整合性と、局所的な領域とフレーズの一致を促進するように改訂された損失関数を用いてモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1画像領域と複数語のフレーズの間でフレーズレベルの注意を適用することで、テキストから画像生成のリアルさと正確性が向上するか?
  • RQ2補助的なバウンディングボックスから得られる真のグリッド領域を用いることで、通常のグリッド領域よりも空間的注意の一致が向上するか?
  • RQ3複雑な視覚的文脈を捉える際、フレーズレベルの埋め込みは語のレベルの埋め込みよりも優れているか?
  • RQ4文に明示的に記述された物体の数や空間的関係を正確に反映した画像を生成できるか?
  • RQ5提案手法により、意味的に異なるが類似した文(例:「surf」と「surfing」)から同じような画像が生成されるのを低減できるか?

主な発見

  • 提案手法は、R-precision(100)が86.44%、R-precision(30K)が9.5%を達成し、AttnGANの85.47%と6.7%を上回った。
  • 『三頭の羊』や『大人と二人の子供』といった明示的な記述において、100%のケースで正しい物体数を生成した。
  • 意味的に異なるが類似した文(例:「surf」と「surfing」)に対しても、AttnGANとは異なり、同一または類似した画像を生成しなかった。
  • 『大きな茶色の牛』や『進むライト付きのストップ・サイン』といった例で、より正確な物体の形状と優れた視覚的整合性を実現した。
  • より高品質なモノクロ画像を生成し、テクスチャと構図の忠実度が向上した。
  • Inceptionスコア23.74±0.36は、AttnGANの25.89±0.47に近く、低スコアであるものの、画像の多様性と品質は良好であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。