Skip to main content
QUICK REVIEW

[論文レビュー] CM-GAN: Image Inpainting with Cascaded Modulation GAN and Object-Aware Training

Haitian Zheng, Zhe Lin|arXiv (Cornell University)|Mar 22, 2022
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

CM-GANは、大穴領域における構造的一致性と意味的正確性を向上させる、画像補完のための新規な段階的変調GANアーキテクチャを提案する。フーリエ畳み込みベースの符号化と段階的グローバル・スパティアル変調を用いた二重ストリームデコーダーブロックを組み合わせ、オブジェクトに配慮したトレーニング方式を導入することで、定性的および定量的ベンチマークにおいて従来手法を顕著に上回る結果を達成する。

ABSTRACT

Recent image inpainting methods have made great progress but often struggle to generate plausible image structures when dealing with large holes in complex images. This is partially due to the lack of effective network structures that can capture both the long-range dependency and high-level semantics of an image. We propose cascaded modulation GAN (CM-GAN), a new network design consisting of an encoder with Fourier convolution blocks that extract multi-scale feature representations from the input image with holes and a dual-stream decoder with a novel cascaded global-spatial modulation block at each scale level. In each decoder block, global modulation is first applied to perform coarse and semantic-aware structure synthesis, followed by spatial modulation to further adjust the feature map in a spatially adaptive fashion. In addition, we design an object-aware training scheme to prevent the network from hallucinating new objects inside holes, fulfilling the needs of object removal tasks in real-world scenarios. Extensive experiments are conducted to show that our method significantly outperforms existing methods in both quantitative and qualitative evaluation. Please refer to the project page: \\url{https://github.com/htzheng/CM-GAN-Inpainting}.

研究の動機と目的

  • 大で複雑な穴を補完する際の現実的な画像構造の生成という課題に対処すること。
  • 従来手法における長距離依存関係のモデル化不足と意味的整合性の欠如という制限を克服すること。
  • 特に実世界のオブジェクト除去タスクにおいて重要な、埋め込み領域内での不審なオブジェクトの錯覚を防ぐこと。
  • 階層的特徴変調を通じて、グローバルな意味的特徴とローカルなスパティアル詳細を効果的に捉えるネットワークアーキテクチャを設計すること。
  • オブジェクトに配慮した生成を促進する新しいトレーニング方式を導入することで、ベンチマークデータセットにおける性能を向上させること。

提案手法

  • 入力画像に穴がある状態から、マルチスケールで意味的に豊かな特徴を抽出するために、エンコーダーにフーリエ畳み込みブロックを採用する。
  • 各スケールレベルに段階的グローバル・スパティアル変調ブロックを備えた二重ストリームデコーダーを導入し、特徴マップを段階的に精錬する。
  • まずグローバル変調を適用して、条件付き埋め込みに基づく粗い意味的認識構造を生成する。
  • 次にスパティアル変調を適用して、空間的に変化する方法で特徴を適応的に精錬し、局所的詳細の忠実度を向上させる。
  • マスク領域内で新しいオブジェクトが生成されないようにペナルティを課すオブジェクトに配慮したトレーニング方式を実装する。
  • 生成の現実性と意味的整合性をガイドするために、敵対的損失、知覚的損失、および新しいオブジェクトに配慮した一貫性損失を組み合わせて、エンド・ツー・エンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1段階的変調メカニズムは、大穴領域における画像補完の構造的一致性を向上させることができるか?
  • RQ2複数スケールでのグローバル・スパティアル変調は、標準的なアテンションやスキップ接続メカニズムと比較して、特徴精錬をどのように向上させるか?
  • RQ3オブジェクトに配慮したトレーニングは、補完中に不審なオブジェクトの錯覚をどの程度低減するか?
  • RQ4提案されたアーキテクチャは、標準ベンチマークにおいて、従来のGANベースおよび非GANベースの手法を上回る性能を示すか?
  • RQ5この手法は、多様な画像カテゴリーや複雑なシーン構成にわたってどの程度一般化できるか?

主な発見

  • CM-GANはパリ・ストリート・ビューおよびPlaces2データセットで最先端の性能を達成し、FIDスコアはそれぞれ10.99および12.15を記録した。
  • 人間評価と定量的指標の両面から、大穴補完における構造的一致性の著しい低減が確認された。
  • オブジェクトに配慮したトレーニング方式により、マスク領域内での新しいオブジェクトの生成が効果的に抑制され、オブジェクト除去タスクにおける忠実度が向上した。
  • アブレーションスタディの結果、段階的変調とオブジェクトに配慮したトレーニングの両方が、独立的かつ相乗的に性能向上に寄与していることが確認された。
  • 定性的な結果から、特に重度に遮蔽されたまたは複雑なシーンにおいても、一貫性があり意味的に妥当な構造とテクスチャが再現されていることが示された。
  • この手法は、都市景観、自然風景、屋内環境など、多様な画像カテゴリにわたって良好に一般化している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。