Skip to main content
QUICK REVIEW

[論文レビュー] RetrieveGAN: Image Synthesis via Differentiable Patch Retrieval

Hung-Yu Tseng, Hsin-Ying Lee|arXiv (Cornell University)|Jul 16, 2020
Generative Adversarial Networks and Image Synthesis参考文献 43被引用数 4
ひとこと要約

RetrieveGANは、シーン記述からの条件付き画像生成のための微分可能でパッチ検索モジュールを提案し、エンドツーエンド学習と相互に適合するパッチの反復的選択を可能にする。Gumbel-softmaxの微分可能性と共起損失を統合することで、意味的に整合的で適合性のあるパッチを備えたより現実的で多様な画像を生成し、定量的指標およびユーザースタディーにおいて非微分可能なベースラインを上回る性能を発揮する。

ABSTRACT

Image generation from scene description is a cornerstone technique for the controlled generation, which is beneficial to applications such as content creation and image editing. In this work, we aim to synthesize images from scene description with retrieved patches as reference. We propose a differentiable retrieval module. With the differentiable retrieval module, we can (1) make the entire pipeline end-to-end trainable, enabling the learning of better feature embedding for retrieval; (2) encourage the selection of mutually compatible patches with additional objective functions. We conduct extensive quantitative and qualitative experiments to demonstrate that the proposed method can generate realistic and diverse images, where the retrieved patches are reasonable and mutually compatible.

研究の動機と目的

  • 非微分可能な検索の限界に対処する。特に、生成プロセスとは分離された事前定義された埋め込みの問題を解消する。
  • 検索プロセス中に共起関係をモデル化することで、検索された画像パッチ同士の相互適合性を向上させる。
  • 検索プロセスを微分可能にすることで、検索と生成パイプラインのエンドツーエンド学習を可能にする。
  • シーングラフ入力を基に、パッチ埋め込みと生成を共同最適化することで、画像生成品質を向上させる。
  • 微分可能で反復的な検索が、意味的に一貫したパッチを備えたより現実的で多様な画像生成をもたらすことを検証する。

提案手法

  • 離散的検索操作を逆伝播可能にするためにGumbel-softmaxトリックを用いた微分可能な検索モジュールを導入する。
  • すでに選択されたパッチに条件づけた、1パッチずつ順次選択する反復的検索戦略を採用する。これにより適合性が保証される。
  • 実画像における共起パターンをモデル化することで、選択されたパッチ同士が互いに適合するよう促進する共起損失関数を設計する。
  • 検索モジュールがシーングラフに意味的に関連するパッチを選択するよう導くために、真値選択損失を用いる。
  • 検索されたパッチを条件付きGANベースの画像生成ネットワークと組み合わせ、最終的な画像を生成する。
  • エンドツーエンドでパイプライン全体を学習し、検索モジュールが画像生成品質を最適化する埋め込み関数を学習可能にする。

実験結果

リサーチクエスチョン

  • RQ1微分可能な検索は、条件付き画像生成に用いるパッチの選択品質と適合性を向上させることができるか?
  • RQ2独立的で非微分可能な検索と比較して、文脈に配慮した反復的検索は、画像の現実性と意味的一致性において優れているか?
  • RQ3検索と生成の共同最適化は、画像の忠実度と多様性をどの程度向上させるか?
  • RQ4提案された共起損失は、シーン内に複数のオブジェクトが存在する場合に、それらの間の相互適合性を効果的にモデル化・強制できるか?
  • RQ5微分可能な検索モジュールは、非微分可能なベースラインと比較して、複雑なシーン記述においてより優れた一般化性能と性能を発揮するか?

主な発見

  • RetrieveGANは、COCO-StuffおよびVisual Genomeデータセットの両方で最先端のFIDスコアを達成し、AttnGAN や PasteGAN などのベースラインと比較して画像の現実性が優れていることを示している。
  • COCO-Stuffでは、より高いインセプションスコア(IS)を達成しており、生成画像の多様性が向上していることを示している。
  • ユーザースタディーの結果、RetrieveGANが検索したパッチはPasteGANのそれと比較して有意に高い適合性を示しており、共起する意味的に整合的なオブジェクトの選択に対して統計的に有意な好みが得られている。
  • アブレーションスタディーにより、真値選択損失および共起損失の両方が、画像品質とパッチ適合性の向上に寄与していることが確認された。
  • 定性的な結果から、RetrieveGANは特に複数の相互作用するオブジェクトを含む複雑なシーンにおいて、より明確で現実的なオブジェクトの外観と空間的一致性を備えた画像を生成していることがわかった。
  • 微分可能な検索モジュールにより、エンドツーエンド学習が可能となり、埋め込み空間が画像生成器と共同で最適化され、検索されたパッチとターゲット画像との間の整合性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。