Skip to main content
QUICK REVIEW

[論文レビュー] Image Inpainting via Conditional Texture and Structure Dual Generation

Xiefan Guo, Hongyu Yang|arXiv (Cornell University)|Aug 22, 2021
Generative Adversarial Networks and Image SynthesisComputer Science参考文献 39被引用数 18
ひとこと要約

本稿では、構造制約付きのテクスチャ生成とテクスチャ誘導型の構造再構築を連携してモデル化する二重スティーム生成ネットワークを提案する。Bi-directional Gated Feature Fusion (Bi-GFF) モジュールと Contextual Feature Aggregation (CFA) モジュールを用いて一貫性と詳細を向上させ、CelebA、Paris StreetView、Places2 データセットで最先端の性能を達成する。

ABSTRACT

Deep generative approaches have recently made considerable progress in image inpainting by introducing structure priors. Due to the lack of proper interaction with image texture during structure reconstruction, however, current solutions are incompetent in handling the cases with large corruptions, and they generally suffer from distorted results. In this paper, we propose a novel two-stream network for image inpainting, which models the structure-constrained texture synthesis and texture-guided structure reconstruction in a coupled manner so that they better leverage each other for more plausible generation. Furthermore, to enhance the global consistency, a Bi-directional Gated Feature Fusion (Bi-GFF) module is designed to exchange and combine the structure and texture information and a Contextual Feature Aggregation (CFA) module is developed to refine the generated contents by region affinity learning and multi-scale feature aggregation. Qualitative and quantitative experiments on the CelebA, Paris StreetView and Places2 datasets demonstrate the superiority of the proposed method. Our code is available at https://github.com/Xiefan-Guo/CTSDG.

研究の動機と目的

  • 構造とテクスチャのモデリングの間の弱い相互作用により、大規模な欠損を扱う現行の深層生成手法の限界を解消すること。
  • 構造とテクスチャ生成を明示的に結合することで、画像補填におけるグローバルな一貫性と詳細品質を向上させること。
  • テクスチャ生成と構造再構築の間で相互監視を可能にする二重スティームアーキテクチャを構築し、より現実的な結果を得ること。
  • 新規モジュールである Bi-GFF および CFA を通じて、特徴の一貫性と長距離依存性を向上させること。

提案手法

  • 本手法は、一方のスティームが構造制約付きのテクスチャ生成を、もう一方がテクスチャ誘導型の構造再構築を実行する二重スティーム生成器を採用し、双方向の特徴相互作用を可能にする。
  • 構造スティームとテクスチャスティーム間で特徴を交換・精錬するため、Bi-directional Gated Feature Fusion (Bi-GFF) モジュールを導入し、一貫性を向上させる。
  • 長距離空間的依存性を領域類似度学習とマルチスケール特徴集約によってモデル化する Contextual Feature Aggregation (CFA) モジュールを導入し、局所的詳細の忠実度を向上させる。
  • 識別器も二重ブランチ構造であり、一方のブランチがテクスチャの現実性を評価し、もう一方が構造のシャープネスを評価することで、共同最適化を可能にする。
  • 生成の現実性、構造、ピクセル単位の正確性のバランスをとるために、 adversarial loss、perceptual loss、L1 loss を用いてネットワークを訓練する。
  • アーキテクチャは CelebA、Paris StreetView、Places2 で評価され、Bi-GFF、CFA、マルチスケール集約のアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1二重スティームアーキテクチャでテクスチャ生成と構造再構築を同時にモデリングすることで、単一スティームまたは逐次的手法と比較して画像補填の品質が向上するか?
  • RQ2Bi-directional Gated Feature Fusion (Bi-GFF) モジュールは、生成されたテクスチャと構造の間の一貫性にどのように影響するか?
  • RQ3Contextual Feature Aggregation (CFA) モジュールは、補填領域における長距離空間的整合性と詳細品質をどの程度向上させるか?
  • RQ4CFA 内のマルチスケール特徴集約は、定量的指標および視覚的品質において測定可能な改善をもたらすか?
  • RQ5標準ベンチマーク上で、定性的および定量的に、本手法は最先端の手法と比較してどの程度優れているか?

主な発見

  • 提案手法は、CelebA、Paris StreetView、Places2 データセットでそれぞれ FID 0.039、0.107、0.226 を達成し、新たな最先端性能を記録した。
  • アブレーションスタディの結果、Bi-GFF モジュールを削除すると FID が 0.045、0.114、0.236 に上昇し、特徴の一貫性に果たす重要性が示された。
  • CFA モジュールを削除した場合、FID は 0.049、0.119、0.243 に上昇し、グローバルな構造とテクスチャ品質の維持におけるその重要性が裏付けられた。
  • CFA 内のマルチスケール特徴集約は、元の単一スケールバージョンと比較して FID を 0.004~0.008 だけ改善し、その有効性が確認された。
  • 10名の専門家によるユーザースタディでは、本手法が最先端手法よりも顕著に好まれ、知覚的現実性が優れていることが示された。
  • 二重スティームアーキテクチャによる二重生成は、単一スティームベースラインおよびマルチタスク単一スティームネットワークを上回り、構造とテクスチャの分離されたが相互に作用するモデリングの利点を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。