Skip to main content
QUICK REVIEW

[論文レビュー] I2T2I: Learning Text to Image Synthesis with Textual Data Augmentation

Hao Dong, Jingqing Zhang|arXiv (Cornell University)|Mar 20, 2017
Multimodal Machine Learning Applications被引用数 18
ひとこと要約

本稿では、画像の説明文作成と画像・テキストのマッピングを繰り返すサイクルを通じて、テキスト的データ拡張を活用することで、テキストから画像への合成の品質を向上させる、I2T2Iという新しいトレーニング手法を提案する。事前学習済みの画像説明文生成モジュールと、GANベースの生成器、およびコントラスト型画像・テキスト埋め込みモジュールを同時に訓練することで、MSCOCOなどのマルチカテゴリデータセット上で生成品質が向上し、人間がアノテートした説明文が存在しないMPII Human Poseデータセットに対してもゼロショットの転移学習が可能となり、複雑な人物や物体の生成において優れた詳細性と現実性を実現する。

ABSTRACT

Translating information between text and image is a fundamental problem in artificial intelligence that connects natural language processing and computer vision. In the past few years, performance in image caption generation has seen significant improvement through the adoption of recurrent neural networks (RNN). Meanwhile, text-to-image generation begun to generate plausible images using datasets of specific categories like birds and flowers. We've even seen image generation from multi-category datasets such as the Microsoft Common Objects in Context (MSCOCO) through the use of generative adversarial networks (GANs). Synthesizing objects with a complex shape, however, is still challenging. For example, animals and humans have many degrees of freedom, which means that they can take on many complex shapes. We propose a new training method called Image-Text-Image (I2T2I) which integrates text-to-image and image-to-text (image captioning) synthesis to improve the performance of text-to-image synthesis. We demonstrate that %the capability of our method to understand the sentence descriptions, so as to I2T2I can generate better multi-categories images using MSCOCO than the state-of-the-art. We also demonstrate that I2T2I can achieve transfer learning by using a pre-trained image captioning module to generate human images on the MPII Human Pose

研究の動機と目的

  • 複雑で変動の大きい被写体(例:人物や動物)を対象としたマルチモーダルなテキストから画像への生成の課題に対処すること。
  • MSCOCOのようなデータセットに存在する多様で多記述的なアノテーションの不足が、テキストから画像への生成性能に制限を及える問題を克服すること。
  • 人間がアノテートした文が存在しない画像データセット(例:MPII Human Poseデータセット)に対してもゼロショットの転移学習を可能にすること。
  • 特に複雑な形状や動的なポーズを有する被写体の生成において、再現性と詳細性を向上させること。

提案手法

  • I2T2Iは、画像説明文生成モジュール、画像・テキストマッピングモジュール、GANベースの画像生成モジュールの3つのモジュールを統合する。
  • 画像説明文生成モジュールは、LSTMデコーダーを用い、top-kサンプリング(k=3)により1枚の画像に対して複数の多様な説明文を生成することで、トレーニングデータの多様性を向上させる。
  • 画像・テキストマッピングモジュールは、コサイン類似度に基づくコントラスト損失関数を用い、画像と文の埋め込みを共通の潜在空間に一致させる。一致するペair間の類似度を最大化し、不一致ペア間の類似度を最小化することで、視覚的・意味的埋め込みの整合性を高める。
  • GAN-CLS生成器は、画像説明文の埋め込みとノイズベクトルの両方を条件として用い、画像・テキストモジュールのRNNエンコーダーを再利用することで、意味的整合性を向上させる。
  • トレーニング中は、各イテレーションで合成された説明文を再生成し、画像に対してランダムな回転、反転、クロップを用いたデータ拡張を適用する。
  • Adam最適化法を用いたエンド・トゥ・エンドのトレーニングを実施し、学習率の段階的減少を適用。画像説明文生成モジュールとGANモジュールを同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1画像の説明文作成によるテキスト的データ拡張が、MSCOCOのようなマルチカテゴリデータセット上でのテキストから画像への合成の品質と多様性を向上させることができるか?
  • RQ2I2T2Iフレームワークは、人間がアノテートした文が存在しないデータセット(例:MPII Human Poseデータセット)に対しても、効果的なゼロショット転移学習を可能にするか?
  • RQ3画像説明文生成と画像・テキストマッピングの統合が、人物や動物のような複雑で変動の大きい被写体の生成能力を向上させるか?
  • RQ4I2T2Iは、GAND-CLSのような最先端手法と比較して、詳細かつ現実的な画像を生成する能力に優れているか?

主な発見

  • I2T2Iは、MSCOCOの検証セット上において、GAND-CLSを上回る高品質な画像を生成し、特に人間の脚、波、便座やバスのような複雑な物体の細部を的確に捉えている。
  • 本手法は、MSCOCOから事前学習済みの画像説明文生成モジュールのみを用いて、人間がアノテートした文の記述が一切ないMPII Human Poseデータセット上でも、現実的な人物のポーズや動的なシーンを合成に成功している。
  • 定性的な結果から、I2T2IはGAND-CLSと比較して、複雑な形状や複数のオブジェクトを含むシーンをより正確かつ詳細に再現していることが示された。
  • 画像説明文生成モジュールを用いた合成された説明文の活用により、トレーニングデータの多様性と耐障害性が著しく向上し、生成器が同じ画像の複数の記述に対して一般化する能力が強化された。
  • 説明文生成、埋め込み、GANモジュールの共同最適化により、意味的整合性が向上し、未学習のデータセットに対してもより優れたゼロショット転移性能が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。