Skip to main content
QUICK REVIEW

[論文レビュー] Semantically Consistent Image Completion with Fine-grained Details

Pengpeng Liu, Xiaojuan Qi|arXiv (Cornell University)|Nov 26, 2017
Generative Adversarial Networks and Image Synthesis参考文献 27被引用数 11
ひとこと要約

本稿では、再構成損失、知覚損失、敵対的損失の3つのレベルの監視を組み合わせた、軽量で完全畳み込み型の生成器を提案する。この手法により、細部にまで及ぶ意味的に整合性のある画像補完が可能となり、CelebAおよびParis StreetViewで最先端の性能を達成した。1000万パラメータ未満で実現されたが、従来手法に比べて細部の再現性と境界の整合性で顕著な優位性を示した。

ABSTRACT

Image completion has achieved significant progress due to advances in generative adversarial networks (GANs). Albeit natural-looking, the synthesized contents still lack details, especially for scenes with complex structures or images with large holes. This is because there exists a gap between low-level reconstruction loss and high-level adversarial loss. To address this issue, we introduce a perceptual network to provide mid-level guidance, which measures the semantical similarity between the synthesized and original contents in a similarity-enhanced space. We conduct a detailed analysis on the effects of different losses and different levels of perceptual features in image completion, showing that there exist complementarity between adversarial training and perceptual features. By combining them together, our model can achieve nearly seamless fusion results in an end-to-end manner. Moreover, we design an effective lightweight generator architecture, which can achieve effective image inpainting with far less parameters. Evaluated on CelebA Face and Paris StreetView dataset, our proposed method significantly outperforms existing methods.

研究の動機と目的

  • 画像補完における低レベルのピクセル再構成と高レベルの敵対的損失のギャップを解消し、細部の合成を制限する要因を克服すること。
  • 事前学習済みCNNを用いた中レベルの知覚的監視を導入し、意味的整合性と詳細の生成を向上させること。
  • パラメータ数を最小限に抑える(<1000万)ことで高い性能を達成する、軽量で完全畳み込み型の生成器アーキテクチャを設計すること。
  • 敵対的訓練と知覚特徴の相乗効果が、自然で詳細的かつ意味的に整合性のある画像補完を実現するかを示すこと。
  • 画像のアライメントや後処理を必要とせず、ランダムなマスクの位置やサイズに対しても頑健な画像補完を実現すること。

提案手法

  • 本手法は、ピクセル単位の再構成損失($L_r$)、敵対的損失($L_a$)、知覚損失($L_p$)を組み合わせたマルチ損失学習戦略を採用し、複数レベルの監視を実現する。
  • 事前学習済みの知覚ネットワークにより、画像を意味的に類似したが外観が異なるコンテンツ同士が近づくように設計された特徴空間に変換することで、中レベルの意味的ガイダンスを実現する。
  • 知覚損失は、知覚ネットワークの複数の層における、元の画像と補完済み画像の特徴マップ間の$L_2$距離として計算される。
  • 長距離のコンテキストを効率的に捉え、パrameter数を削減しつつ高解像度出力を生成できる、新規の軽量で完全畳み込み型生成器(FCNベース)を設計した。
  • ディスクライマーはグローバルな自然さと境界の連続性を強制するが、生成器は3つの損失すべてを用いてエンド・ツー・エンドで学習される。
  • フレームワークはエンド・ツー・エンドで学習され、推論には生成子のみを必要とし、リアルタイム応用が可能である。

実験結果

リサーチクエスチョン

  • RQ1再構成損失、敵対的損失、知覚損失は画像補完においてどのように作用し合い、それぞれが細部や整合性に与える寄与度は何か?
  • RQ2類似度を強化した特徴空間における知覚的監視は、アーティファクトを生成せずに細部の合成を向上させられるか?
  • RQ3敵対的訓練と知覚特徴は、意味的に整合的で現実的である画像補完を生成するために、どの程度相乗効果を発揮するか?
  • RQ4軽量で完全畳み込み型の生成器は、大幅に少ないパラメータ数で大規模モデルと同等の性能を達成できるか?
  • RQ5特に顔や都市風景のような複雑なシーンにおいて、ランダムなマスクの位置やサイズに対して本手法はどの程度頑健か?

主な発見

  • 敵対的損失と知覚損失の組み合わせにより、細部にまで及ぶ再現性と境界の整合性を備えた結果が得られ、$L_r$、$L_a$、$L_p$ のいずれか1つだけを用いたモデルに比べて顕著に優れた性能を示した。
  • Paris StreetViewデータセットにおいて、本手法は$L_r + L_a + L_p$を用いて21.5338 dBのPSNRを達成し、Context Encoder(20.4878 dB)を上回り、ランダムマスク設定下でも性能低下が最小限に抑えられた。
  • 本手法は、CelebAおよびParis StreetViewにおいても、ランダムなマスクの位置やサイズに対して強く性能を維持したが、Context Encoderのような固定マスクを必要とするモデルとは対照的であった。
  • 1000万パラメータ未満の軽量生成器が最先端の性能を達成した。これは、高い性能を達成するためには巨大なモデルサイズを必要としないことを示している。
  • 定性的な結果から、本手法は人、看板、ヒゲなどのオブジェクトを効果的に除去しながら、意味的に整合性を保ちつつ現実的で新規のコンテンツを生成できることを示した。
  • 失敗事例は、トレーニングデータに該当例が不足する場合(例:プロファイル顔、対称構造)に発生し、トレーニング分布を超えた一般化の限界を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。