Skip to main content
QUICK REVIEW

[論文レビュー] Deep Generative Model for Image Inpainting with Local Binary Pattern Learning and Spatial Attention

Haiwei Wu, Jiantao Zhou|arXiv (Cornell University)|Sep 2, 2020
Generative Adversarial Networks and Image Synthesis参考文献 56被引用数 7
ひとこと要約

本論文は、欠損領域の局所的バイナリパターン(LBP)特徴をU-NetベースのLBP学習ネットワークで予測する第1段階と、その特徴を用いて空間的アテンションを備えた画像補完ネットワークを制御する2段階の深層生成モデルを提案する。本研究で提唱する空間的アテンション機構は、既知領域と生成領域の間の依存関係に加え、生成領域内部の依存関係までモデル化し、アーチファクトを顕著に低減し、構造的一致性を向上させる。この手法は、CelebA-HQ、Places、Paris StreetViewのデータセットにおいて、最先端の手法を上回る性能を発揮する。

ABSTRACT

Deep learning (DL) has demonstrated its powerful capabilities in the field of image inpainting. The DL-based image inpainting approaches can produce visually plausible results, but often generate various unpleasant artifacts, especially in the boundary and highly textured regions. To tackle this challenge, in this work, we propose a new end-to-end, two-stage (coarse-to-fine) generative model through combining a local binary pattern (LBP) learning network with an actual inpainting network. Specifically, the first LBP learning network using U-Net architecture is designed to accurately predict the structural information of the missing region, which subsequently guides the second image inpainting network for better filling the missing pixels. Furthermore, an improved spatial attention mechanism is integrated in the image inpainting network, by considering the consistency not only between the known region with the generated one, but also within the generated region itself. Extensive experiments on public datasets including CelebA-HQ, Places and Paris StreetView demonstrate that our model generates better inpainting results than the state-of-the-art competing algorithms, both quantitatively and qualitatively. The source code and trained models will be made available at https://github.com/HighwayWu/ImageInpainting.

研究の動機と目的

  • 深層学習に基づく画像補完において、特にテクスチャ領域や境界領域で継続的に発生するアーチファクトや構造的一致性の欠如という問題に取り組む。
  • LBP特徴からの構造的事前知識を活用することで、補完領域におけるグローバルおよびローカルの一貫性を向上させる。
  • 新規の空間的アテンション機構により、生成領域内の内部依存関係をモデル化することで、特徴表現を強化する。
  • 複数のネットワーク層にまたがるマルチレベル損失関数を用いることで、訓練の安定性を向上させ、特徴の忠実度を向上させる。
  • 公開ベンチマークにおいて、定性的および定量的に最先端の性能を達成する。

提案手法

  • 2段階のフレームワークを採用:まず、U-NetベースのLBP学習ネットワークが、既知のコンテキストを用いて欠損領域のLBP特徴マップを予測する。
  • 予測されたLBP特徴を構造的事前知識として活用し、その後続の画像補完ネットワークが意味的に妥当で構造的に整合性のあるコンテンツを生成するように誘導する。
  • 補完ネットワークに新規の空間的アテンション機構を統合し、領域間依存関係(既知領域 vs. 生成領域)と領域内依存関係(生成領域内部)をモデル化することで、一貫性を向上させる。
  • アテンション機構は32×32の特徴解像度で動作し、1トークンあたりT=2のパッチを処理することで、効率性と性能のバランスを図る。
  • 複数のエンコーダ・デコーダ層にまたがるマルチレベル損失関数を適用し、特徴忠実度の最適化と訓練の安定性を向上させる。
  • 生成的対抗ネットワーク(GAN)を上記の構成要素と併せて共同で訓練することで、リアリズムと知覚的品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1LBP特徴は、パラメータフリーな構造的事前知識として画像補完を誘導し、アーチファクトを低減するのに有効であるか?
  • RQ2生成領域内部の依存関係をモデル化することで、従来のアテンション機構と比較して構造的一致性が向上するか?
  • RQ3本手法の2段階的・粗いから細かいフレームワークは、エンドツーエンドのGANベース手法と比較して、視覚的品質および定量的指標で優れているか?
  • RQ4マルチレベル損失は、特徴再構成および最終的な補完性能をどの程度向上させるか?
  • RQ5本手法は、顔、自然景観、街路風景など多様な画像ドメインに一般化可能か?

主な発見

  • 中心マスクを用いたPlacesデータセットにおいて、マルチレベル損失を含まないベースラインと比較して、PSNRで約0.11 dBの向上を達成した。
  • Placesデータセットにおいて、マルチレベル損失を適用した場合、PSNRは24.31、SSIMは0.845を記録し、それ以外のバージョン(PSNR: 24.20、SSIM: 0.844)を上回った。
  • CelebA-HQ、Places、Paris StreetViewにおける定性的な結果は、最先端の手法と比較して境界アーチファクトが低減され、テクスチャの一貫性が向上していることを示した。
  • アブレーションスタディの結果、内部依存関係をモデル化する本研究の空間的アテンション機構が、ローカル一貫性を著しく向上させ、幻覚現象を低減することが確認された。
  • LBPを構造的事前知識として統合することで、顔やテクスチャのような複雑な領域における構造的再構成の正確性が向上した。
  • 顔画像、自然景観、都市の街路風景など多様なデータセットにわたる一般化能力を示し、視覚的に妥当で意味的に整合性のある結果を提示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。