Skip to main content
QUICK REVIEW

[論文レビュー] DoveNet: Deep Image Harmonization via Domain Verification

Wenyan Cong, Jianfu Zhang|arXiv (Cornell University)|Nov 27, 2019
Generative Adversarial Networks and Image Synthesis参考文献 9被引用数 12
ひとこと要約

本稿では、合成画像における前景領域と背景領域のドメインを一致させるために、新規のドメイン検証識別器を用いた深層学習手法DoveNetを提案する。本手法は、COCO、Adobe5k、Flickr、day2nightデータセットから厳密なフィルタリングを施して作成された、高品質で現実的な合成画像を含む大規模な新規データセットiHarmony4において、最先端の性能を達成した。

ABSTRACT

Image composition is an important operation in image processing, but the inconsistency between foreground and background significantly degrades the quality of composite image. Image harmonization, aiming to make the foreground compatible with the background, is a promising yet challenging task. However, the lack of high-quality publicly available dataset for image harmonization greatly hinders the development of image harmonization techniques. In this work, we contribute an image harmonization dataset iHarmony4 by generating synthesized composite images based on COCO (resp., Adobe5k, Flickr, day2night) dataset, leading to our HCOCO (resp., HAdobe5k, HFlickr, Hday2night) sub-dataset. Moreover, we propose a new deep image harmonization method DoveNet using a novel domain verification discriminator, with the insight that the foreground needs to be translated to the same domain as background. Extensive experiments on our constructed dataset demonstrate the effectiveness of our proposed method. Our dataset and code are available at https://github.com/bcmi/Image_Harmonization_Datasets.

研究の動機と目的

  • 既存の画像調和化データセットにおける低リアルさと多様性の不足が、堅牢な深層学習モデルの学習を妨げているという課題に対処すること。
  • 前景と背景の不一致を制御的に組み合わせた実画像から合成画像を生成することで、データ効率的かつ高品質なトレーニングパイプラインを構築すること。
  • 敵対的ドメイン検証を用いて、前景のドメインを背景のドメインに明示的に一致させる新しい深層画像調和化手法DoveNetを提案すること。
  • HCOCO、HAdobe5k、HFlickr、Hday2nightの4つのサブデータセットを含む、大規模で多様性に富み、高品質な画像調和化データセットiHarmony4を構築・公開すること。
  • データセットのキュレーション段階で、代表的でない、現実的でない、または意味的に無効な合成画像を除外することで、調和化された画像の汎用性とリアルさを向上させること。

提案手法

  • COCO、Adobe5k、Flickr、day2nightデータセットの実画像から、前景セグメンテーションと自動色移行を用いて合成画像を生成することで、新しい画像調和化データセットiHarmony4を構築する。
  • 手動によるフィルタリングを適用し、被覆された物体、現実的でない色の変化、および余分な変化(例:電灯の点灯)を含む低品質な合成画像を除去することで、データセットの品質を保証する。
  • ペアの前景および背景特徴が実画像から得られた場合をポジティブペア、合成画像から得られた場合をネガティブペアとして扱う、ドメイン検証識別器を備えたGANベースの調和化モデルDoveNetを提案する。
  • ドメイン検証識別器を訓練し、前景と背景が同じドメイン(実画像)から来ているか、異なるドメイン(合成画像)から来ているかを識別させることで、ドメインの一致を促進する。
  • 内容を保持しつつ色調や照明を調和させるために、知覚的損失、敵対的損失、再構成損失を組み合わせたマルチ損失トレーニング目的関数を用いる。
  • 画像調和化がドメイン適応に等価であるという洞察を活用:明示的なドメインラベルがなくても、前景を背景のドメインに合わせて変換する。

実験結果

リサーチクエスチョン

  • RQ1多様性とリアルさに欠ける既存のデータセットの制限を克服するため、合成された大規模かつ高品質な画像調和化データセットを構築できるか?
  • RQ2明示的なドメインラベルを必要とせずに、ドメイン検証識別器が合成画像における前景ドメインと背景ドメインを効果的に一致させられるか?
  • RQ3提案されたDoveNetモデルは、合成画像および実際の合成画像の両方において、定量的指標および定性的な視覚的結果の両面で、既存の最先端手法を上回るか?
  • RQ4特に「person」のようなカテゴリ内に高いばらつきを示すものにおいて、モデルの汎用性はどの程度か?
  • RQ5合成画像の手動フィルタリングが、トレーニングデータの品質と信頼性、および下流のモデル性能をどの程度向上させるか?

主な発見

  • HCOCO、HAdobe5k、HFlickr、Hday2nightのサブデータセットを含む、提案されたiHarmony4データセットは、画像調和化のための大規模で多様性に富み、高品質なベンチマークを提供する。
  • HCOCOサブデータセットにおいて、DoveNetはfMSE(前景平均二乗誤差)で顕著な改善を達成し、「mouse」カテゴリでは最大1,141.57の低下、「keyboard」カテゴリでは1,058.59の低下を記録した。
  • カテゴリ内ばらつきが著しい「person」カテゴリにおいても、DoveNetは437.32のfMSE低下を達成し、困難な変動に対しても頑健であることを示した。
  • 99枚の実合成画像に対するユーザースタディおよび定性的な結果から、DIH、S2AM、Xue et al. などの既存手法と比較して、DoveNetはより自然で調和の取れた結果を生成することが分かった。
  • ドメイン検証識別器は、実画像(ポジティブ)と合成画像(ネガティブ)ペアを高精度で識別できることから、前景と背景のドメインの一致を効果的に学習していることが裏付けられた。
  • 手動フィルタリングにより、電灯の点灯や雪の出現といった現実的でない変化、部分的に被覆された人物などの意味的に無意味なオブジェクトを含む合成画像が除去され、より信頼性の高いトレーニングが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。