Skip to main content
QUICK REVIEW

[論文レビュー] On the Diversity of Realistic Image Synthesis

Zichen Yang, Haifeng Liu|arXiv (Cornell University)|Dec 20, 2017
Advanced Image Processing Techniques参考文献 30被引用数 5
ひとこと要約

本稿では、条件付きGANを用いて意味的レイアウトから多様で現実的な画像を生成するための多様性損失目的関数を提案する。入力ノイズを意味的セグメントにリンクさせ、ノイズの差異に基づいて出力間の距離を最大化することで、画像の現実性を損なわず、多様性を高めつつユーザーが制御可能な操作を可能にする。ベースラインモデルに比べ、多様性は向上し、忠実度も維持される。

ABSTRACT

Many image processing tasks can be formulated as translating images between two image domains, such as colorization, super resolution and conditional image synthesis. In most of these tasks, an input image may correspond to multiple outputs. However, current existing approaches only show very minor diversity of the outputs. In this paper, we present a novel approach to synthesize diverse realistic images corresponding to a semantic layout. We introduce a diversity loss objective, which maximizes the distance between synthesized image pairs and links the input noise to the semantic segments in the synthesized images. Thus, our approach can not only produce diverse images, but also allow users to manipulate the output images by adjusting the noise manually. Experimental results show that images synthesized by our approach are significantly more diverse than that of the current existing works and equipping our diversity loss does not degrade the reality of the base networks.

研究の動機と目的

  • 1つの入力に対して複数の妥当な出力が得られるにもかかわらず、条件付き画像生成における多様性の欠如に対処すること。
  • 入力ノイズの手動調整によって生成画像をユーザーが操作可能にすること。
  • 顕著に多様性を高めつつも、高い画像の現実性を維持すること。
  • さまざまな基本生成ネットワークに適用可能なプラグイン互換の損失関数を開発すること。

提案手法

  • 1. 入力ノイズベクトルの距離に基づいて出力画像間の距離を最大化する多様性損失を導入する。
  • 2. ノイズベクトルの各次元をレイアウト内の特定の意味的セグメントにリンクさせ、局所的な画像操作を可能にする。
  • 3. 生成器ネットワークを変更し、意味的レイアウトを入力チャネルとしてノイズを連結することで、条件付きにノイズを使用するようにする。
  • 4. 基本ネットワーク損失(例:敵対的損失またはL1)とハイパーパrameter βを用いた多様性損失の組み合わせでネットワークを訓練する。
  • 5. 各トレーニングサンプルに対して2回の順伝播を実行:1回目はランダムノイズ、2回目はゼロノイズで、多様性損失を計算する。
  • 6. ピクセル2pix や CRN などの既存モデルに、アーキテクチャの変更なしに多様性損失をプラグインモジュールとして適用する。

実験結果

リサーチクエスチョン

  • RQ1単純でモジュラーな損失関数は、現実性を損なわず、画像生成における多様性を顕著に向上させることができるか?
  • RQ2入力ノイズを意味的セグメントに意味的にリンクさせることで、細かく直感的な画像操作を実現できるか?
  • RQ3多様性損失は、さまざまな基本生成モデルにどの程度一般化可能か?
  • RQ4多様性損失は、基本ネットワークの画像品質と構造的忠実度を維持するか?
  • RQ5各意味的クラスごとにノイズ次元を独立して変化させることで、指数関数的に多様な出力を生成できるか?

主な発見

  • 提案された多様性損失は、Pix2pix や CRN といったベースラインモデルと比較して、質的・定量的分析の両面で顕著な出力の多様性向上を達成した。
  • 多様性損失は画像の現実性を劣化させない。FID や LPIPS などの評価指標では、画像品質に顕著な低下は認められなかった。
  • 個々のノイズ次元の調整により、ユーザーが画像編集を制御可能であり、特定の意味的セグメントを独立して操作できる。
  • 多様性損失は、CMP Facades および Cityscapes といった異なるデータセットおよび基本モデルに効果を示し、広範な適用可能性を示した。
  • 意味的クラス数(k^n)に比例して、可能な多様な出力の数が指数関数的に増加し、現実的な画像バリアントの多様なバリエーションを生成可能となった。
  • 単純なレイアウトでさえも、窓の種類や壁のテクスチャの構造的変化を効果的に生成できたが、極めて単純な入力では性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。