Skip to main content
QUICK REVIEW

[論文レビュー] Region-aware Adaptive Instance Normalization for Image Harmonization

Jun Ling, Han Xue|arXiv (Cornell University)|Jun 5, 2021
Generative Adversarial Networks and Image Synthesis参考文献 40被引用数 11
ひとこと要約

本稿では、画像調和化における前景に背景の視覚的スタイルを転送するための新しい正規化モジュール、領域認識的適応的インスタンス正規化(RAIN)を提案する。マスク誘導型で領域認識のメカニズムを用いて、前景特徴統計を背景統計に適応的に一致させることで、リアルさが著しく向上し、従来手法を上回る。PSNRでは最大1.37dB、推定誤差では12.07の向上を達成した。

ABSTRACT

Image composition plays a common but important role in photo editing. To acquire photo-realistic composite images, one must adjust the appearance and visual style of the foreground to be compatible with the background. Existing deep learning methods for harmonizing composite images directly learn an image mapping network from the composite to the real one, without explicit exploration on visual style consistency between the background and the foreground images. To ensure the visual style consistency between the foreground and the background, in this paper, we treat image harmonization as a style transfer problem. In particular, we propose a simple yet effective Region-aware Adaptive Instance Normalization (RAIN) module, which explicitly formulates the visual style from the background and adaptively applies them to the foreground. With our settings, our RAIN module can be used as a drop-in module for existing image harmonization networks and is able to bring significant improvements. Extensive experiments on the existing image harmonization benchmark datasets show the superior capability of the proposed method. Code is available at {https://github.com/junleen/RainNet}.

研究の動機と目的

  • 画像合成における前景と背景の間の視覚的スタイルの不一致という継続的な問題に対処する。
  • 画像調和化を、照明、色温度、彩度、テクスチャの一致に焦点を当てたスタイル転送タスクとして再定式化する。
  • 背景の視覚的スタイルを明示的に学習し、前景に適用する、プラグアンドプレイ可能な正規化レイヤーを開発する。
  • 既存の調和化ネットワークのアーキテクチャを大幅に変更することなく、合成画像のリアルさを向上させる。
  • 複数のベンチマークおよびユーザースタディにおいて一貫した性能向上を示す。

提案手法

  • 背景特徴からのみスタイル統計(平均と分散)を計算する領域認識的適応的インスタンス正規化(RAIN)モジュールを提案する。
  • 前景セグメンテーションマスクを用いて前景活性化を分離し、スタイル適応をこれらの領域にのみ適用する。
  • 背景特徴から導出されたチャネル別平均および分散に一致するように、再パラメータライズすることで前景特徴マップを適応的に正規化する。
  • 既存の画像調和化ネットワークに、特にデコーダー部に最適なパフォーマンスを得るために、RAINをプラグインモジュールとして統合する。
  • 敵対的損失および知覚的損失を用いて、リアルさと構造的一致性を保持するように、ネットワークをエンドツーエンドで訓練する。
  • 特徴一致とトレーニングの安定化を図るため、エンコーダーとデコーダーの対応する層にRAINレイヤーを配置する対称的設計を採用する。

実験結果

リサーチクエスチョン

  • RQ1スタイルガイドランスなしでエンドツーエンドマッピングを行う場合と比較して、明示的な背景から前景へのスタイル転送は、合成画像のリアルさを向上させるか?
  • RQ2前景のみをターゲットとする領域認識スタイル適応は、グローバル正規化と比較して、視覚的一致性を保つ上でどのように優れているか?
  • RQ3画像調和化のパフォーマンスを最大化するために、RAINモジュールの最適な配置(例:エンコーダー対デコーダー)はどこか?
  • RQ4アーキテクチャの刷新なしに、既存のネットワークにどれほどRAINを統合してパフォーマンスを向上させられるか?
  • RQ5実世界の画像合成において、ユーザープreferencesスタディにおいて、RAINは最先端手法と比較してどの程度の性能を示すか?

主な発見

  • RAINをDIHネットワークに適用した場合、DIHベンチマークでPSNRが33.84dBに達し、ベースライン比+0.48dBの向上を達成した。
  • 提案手法は、前景推定誤差(fMSE)を顕著に低減し、前景の外観が背景に適切に一致していることを示した。
  • ユーザースタディの結果、32.5%の投票がRainNetによる調和化画像を好んだ。これは、すべての競合手法を上回った。
  • RAINは、インスタンス正規化(IN)およびバッチ正規化(BN)の両方を上回り、DoveNetより最大1.37dBのPSNR向上を達成した。
  • デコーダーにRAINを配置し、エンコーダーにINを配置した場合が最良のパフォーマンスを示し、RAIN-1(1層)が深い構成をわずかに上回った。
  • 定量的・定性的な評価を通じて、特に照明やテクスチャの異なる複雑なシーンにおいて、視覚的スタイルの不一致が効果的に低減されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。