Skip to main content
QUICK REVIEW

[論文レビュー] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guided Image Generation

Hao Tang, Dan Xu|arXiv (Cornell University)|Aug 2, 2019
Generative Adversarial Networks and Image Synthesis参考文献 52被引用数 9
ひとこと要約

本稿では、3つのサイクル型サブネットワーク(1つの画像生成サイクルと2つのキーポイント生成サイクル)を介して、キーポイント誘導型画像生成とキーポイント再構築を共同で学習する、新しい生成的敵対ネットワークであるCycle In Cycle GAN (C²GAN) を提案する。画像とキーポイントモダリティの間で双方向的かつエンドツーエンドの最適化を可能にすることで、C²GANは顔の表情や人物ポーズ生成タスクにおいて、最先端のモデルよりもよりリアルで詳細な画像を生成する。

ABSTRACT

In this work, we propose a novel Cycle In Cycle Generative Adversarial Network (C$^2$GAN) for the task of keypoint-guided image generation. The proposed C$^2$GAN is a cross-modal framework exploring a joint exploitation of the keypoint and the image data in an interactive manner. C$^2$GAN contains two different types of generators, i.e., keypoint-oriented generator and image-oriented generator. Both of them are mutually connected in an end-to-end learnable fashion and explicitly form three cycled sub-networks, i.e., one image generation cycle and two keypoint generation cycles. Each cycle not only aims at reconstructing the input domain, and also produces useful output involving in the generation of another cycle. By so doing, the cycles constrain each other implicitly, which provides complementary information from the two different modalities and brings extra supervision across cycles, thus facilitating more robust optimization of the whole network. Extensive experimental results on two publicly available datasets, i.e., Radboud Faces and Market-1501, demonstrate that our approach is effective to generate more photo-realistic images compared with state-of-the-art models.

研究の動機と目的

  • 疎なキーポイントの監視のもとで、オクルージョンや照明の変動といった複雑な条件下でも、写真のようにリアルな画像を生成する課題に対処すること。
  • 複数のドメインにスケーリングが悪く、人間のポーズやジェスチャー生成のような無限ドメインタスクで失敗する既存の非ペaired画像対画像変換モデルの限界を克服すること。
  • 相互監視によって耐性と詳細な忠実度を向上させるために、画像とキーポイント生成の共同学習を可能にすること。
  • 画像の再構築と条件付き入力からの正確なキーポイントレイアウト予測を同時に実行できる統合的かつエンドツーエンドで学習可能なフレームワークの開発

提案手法

  • キーポイント指向の生成器と画像指向の生成器を備えたデュアル生成器アーキテクチャを導入し、サイクル的かつエンドツーエンドの形で接続する。
  • 3つのサイクル型サブネットワークを構築する:1つの画像対画像サイクル(画像 → キーポイント → 画像)と2つのキーポイント対キーポイントサイクル(キーポイント → 画像 → キーポイント)により、双方向再構築を可能にする。
  • 生成画像のリアルさと予測されたキーポイントレイアウトの一貫性を強制するために、敵対的学習と識別器を用いる。
  • 再構築された画像とキーポイントが元の入力と密接に一致することを保証するため、サイクル整合性損失を適用し、モダリティ間の追加的監視を提供する。
  • 敵対的損失、サイクル整合性損失、および知覚的損失を含む組み合わせ損失関数を用いて、ネットワーク全体をエンドツーエンドで最適化する。
  • 最小限のアーキテクチャ調整で、任意の画像サイズでの推論を可能にし、柔軟なデプロイメントを支援する。

実験結果

リサーチクエスチョン

  • RQ1統合的な生成モデルは、サイクル的かつクロスモダリティ監視によって、画像とキーポイント生成の両方を同時に向上させることができるか?
  • RQ2提案されたC²GANフレームワークは、キーポイント誘導型顔の表情および人物ポーズ生成において、最先端のモデルと比較してどの程度の性能を示すか?
  • RQ3画像とキーポイント生成器の間のサイクル的相互作用は、生成品質の向上とモード崩壊の低減にどの程度寄与するか?
  • RQ4オクルージョンや変動する照明を伴う多様な画像サイズや複雑な現実世界のシナリオにも一般化可能か?
  • RQ5画像とキーポイント生成の共同学習は、単一モダリティアプローチと比較して、より優れた知覚的品質と構造的忠実度をもたらすか?

主な発見

  • Radboud Facesデータセットでは、C²GANはランドマーク誘導型顔の表情生成において、FID、LPIPS、SSIM、ISのすべての指標で最高の性能を達成し、GPGAN、PG²、その他のSOTAモデルを上回った。
  • Market-1501データセットでは、C²GANはPG²やPoseGANよりもよりリアルで詳細な人物画像を生成し、特にアイデンティティ、衣装、帽子などのアクセサリーの保持に優れていた。
  • 部分的オクルージョンや複雑な背景といった挑戦的な状況でも、C²GANは正しく人物とポーズを生成できたが、PG²やPoseGANは意味のある出力を得られなかった。
  • キーポイント生成器は、顔のランドマークや人体の関節などの高精度なキーポイント予測を生成し、定性的および定量的評価で、生成されたキーポイントレイアウトが正解に密接に一致した。
  • C²GANはキーポイント誘導型人物画像生成において、AMT(R2G)、マスク-SSIM、マスク-ISの指標でPG²やDPIGを上回り、ISではPoseGANと同等の性能を示したが、他の指標で優れた結果を出した。
  • 強いサイクル制約と明示的なクロスモダリティ監視のおかげで、C²GANはキーポイント誘導タスクにおけるモード崩壊に対して強く、入力固有のコンテンツを忠実に再構築できることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。