Skip to main content
QUICK REVIEW

[論文レビュー] WaveFill: A Wavelet-based Generation Network for Image Inpainting

Yingchen Yu, Fangneng Zhan|arXiv (Cornell University)|Jul 23, 2021
Advanced Image Processing Techniques参考文献 46被引用数 8
ひとこと要約

WaveFillは、離散ウェーブレット変換(DWT)を用いて画像を周波数帯に分解するウェーブレットベースの画像補完ネットワークを提案する。これにより、低周波数構造のL1損失と高周波数ディテールの adversarial 損失を別々に最適化できる。周波数に分離されたアプローチにより、周波数間の競合を軽減し、特徴量の一貫性を保つために新規の周波数領域に特化した正規化(FRAN)モジュールを導入。複数のベンチマークで定性的および定量的に最先端の性能を達成した。

ABSTRACT

Image inpainting aims to complete the missing or corrupted regions of images with realistic contents. The prevalent approaches adopt a hybrid objective of reconstruction and perceptual quality by using generative adversarial networks. However, the reconstruction loss and adversarial loss focus on synthesizing contents of different frequencies and simply applying them together often leads to inter-frequency conflicts and compromised inpainting. This paper presents WaveFill, a wavelet-based inpainting network that decomposes images into multiple frequency bands and fills the missing regions in each frequency band separately and explicitly. WaveFill decomposes images by using discrete wavelet transform (DWT) that preserves spatial information naturally. It applies L1 reconstruction loss to the decomposed low-frequency bands and adversarial loss to high-frequency bands, hence effectively mitigate inter-frequency conflicts while completing images in spatial domain. To address the inpainting inconsistency in different frequency bands and fuse features with distinct statistics, we design a novel normalization scheme that aligns and fuses the multi-frequency features effectively. Extensive experiments over multiple datasets show that WaveFill achieves superior image inpainting qualitatively and quantitatively.

研究の動機と目的

  • 空間ドメインで同時最適化される再構成損失と adversarial 損失によって引き起こされる知覚と歪みのトレードオフを解消すること。
  • 空間特徴量が混在する状態でL1損失と adversarial 損失を併用した際に生じる周波数間の競合を軽減すること。
  • 画像補完中に周波数帯間で構造的およびテクスチャ的整合性を向上させること。
  • 複数の周波数特徴量を効果的に整列・統合する正規化機構を開発し、アーティファクトの低減とディテールの保持を実現すること。
  • 長方形および自由形状のマスクを含む多様なデータセットで優れた補完結果を達成すること。

提案手法

  • ネットワークは2次元離散ウェーブレット変換(DWT)を用いて、入力画像を低周波数(LF)、レベル2の高周波数(Lv2-HF)、レベル1の高周波数(Lv1-HF)帯に分解し、空間情報を保持する。
  • 低周波数帯はゲート付き残差ブロック(GC ResBlock)によるL1再構成損失で補完され、高周波数帯はテクスチャの現実性を向上させるために adversarial 損失で処理される。
  • 低周波数から高周波数へ注目を向ける新しい周波数領域に特化した正規化(FRAN)モジュールを導入し、複数周波数特徴量の整列と統合を実現し、一貫性のある生成を実現する。
  • 異なる周波数ブランチからの特徴量がFRANを介して伝搬され、周波数固有の統計に基づいて注目マップが計算され、特徴量統合をガイドする。
  • 完成した周波数帯は逆離散ウェーブレット変換(IDWT)を用いて空間ドメインに再構成され、最終的な補完画像が得られる。
  • ハイブリッド損失を用いてエンドツーエンドで学習され、低周波数帯ではL1損失、高周波数帯では adversarial 損失が組み合わされる。

実験結果

リサーチクエスチョン

  • RQ1周波数帯ごとに再構成損失と知覚損失の最適化を分離することで、画像補完における周波数間の競合を軽減できるか?
  • RQ2空間ドメインまたはDCTベースの手法と比較して、ウェーブレットに基づく周波数分解は、構造的およびテクスチャ的ディテールの保持にどのように寄与するか?
  • RQ3周波数に意識的な正規化方式は、複数周波数ブランチ間の特徴量整列と整合性を向上させられるか?
  • RQ4提案されたFRANモジュールは、画像補完中にアーティファクトを効果的に抑制し、微細なテクスチャディテールを保持できるか?
  • RQ5WaveFillは、マスクタイプが異なる多様な補完ベンチマークで、最先端の手法をどの程度上回るか?

主な発見

  • Paris StreetView検証セット(不規則なマスク)において、WaveFillはFID 31.02を達成し、ベースライン(33.95)とDCTベースモデル(100.93)を上回った。
  • 同じベンチマークでPSNR 28.94、SSIM 0.904を達成し、優れた構造的および知覚的品質を示した。
  • ユーザースタディーでは、Paris StreetViewで68.0%、Places2で72.0%、CelebA-HQで70.0%のケースでWaveFillが最も現実的な補完と評価され、競合他者を大きく上回った。
  • アブレーションスタディーにより、DCTおよび空間ドメインベースラインと比較してウェーブレット分解が性能向上に寄与することが確認され、FIDはDCTの100.93からWaveFill + FRANの31.02に低下した。
  • FRANモジュールはアーティファクトを低減させ、意味的整合性を向上させた。視覚的比較では、WaveFillはGC、GMCNN、ECと比較して歪みが少なく、よりシャープなテクスチャを生成した。
  • ウェーブレット分解とFRANの組み合わせにより、特徴量連結を用いたベースラインモデルと比較して、FIDは2.5%改善され、PSNRは0.5 dB向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。