Skip to main content
QUICK REVIEW

[論文レビュー] SEIGAN: Towards Compositional Image Generation by Simultaneously Learning to Segment, Enhance, and Inpaint

Pavel Ostyakov, Roman Suvorov|arXiv (Cornell University)|Nov 19, 2018
Generative Adversarial Networks and Image Synthesis参考文献 33被引用数 16
ひとこと要約

SEIGANは、境界ボックスの監視のみを用いて、画像合成中に同時にセグメンテーション、強調処理、穴埋めを学習するエンドツーエンドの生成的敵対ネットワークを提案する。サイクル整合性と敵対的訓練を活用することで、教師ありマスクが不要な状態で、最先端のセグメンテーションmIoUと人間評価における優れた知覚的画像品質を達成した。

ABSTRACT

We present a novel approach to image manipulation and understanding by simultaneously learning to segment object masks, paste objects to another background image, and remove them from original images. For this purpose, we develop a novel generative model for compositional image generation, SEIGAN (Segment-Enhance-Inpaint Generative Adversarial Network), which learns these three operations together in an adversarial architecture with additional cycle consistency losses. To train, SEIGAN needs only bounding box supervision and does not require pairing or ground truth masks. SEIGAN produces better generated images (evaluated by human assessors) than other approaches and produces high-quality segmentation masks, improving over other adversarially trained approaches and getting closer to the results of fully supervised training.

研究の動機と目的

  • コンポジション画像生成のための統合的ディープラーニングフレームワークを構築すること。このフレームワークは、セグメンテーション、オブジェクト強調処理、背景の穴埋めを統合的に実行する。
  • 教師ありセグメンテーションマスクやペアドデータを必要としない弱い監視、具体的には境界ボックスのアノテーションのみを用いてモデルを学習すること。
  • 共同最適化とサイクル整合性を活用して、生成画像の知覚的品質とセグメンテーションマスクの正確性を向上させること。
  • カット、ペースト、リカバリの操作を意味的に一貫した方法で実行する1つのモデルをエンドツーエンドで訓練できること。

提案手法

  • SEIGANは、セグメンテーション、強調処理、穴埋めの各タスクに共通のエンコーダ・デコーダ構造を有するGANベースのアーキテクチャを採用し、エンドツーエンドで学習する。
  • オブジェクトを切り取り、その後背景を復元した際に元の画像が得られるようにするため、サイクル整合性損失を用いて構造的一致性を確保する。
  • 生成画像の現実性を評価するディスクライマーを用いた敵対的訓練により、知覚的品質を向上させる。
  • セグメンテーションは、オブジェクトマスクを出力するジェネレータヘッドによって実行され、このマスクがオブジェクトの貼り付けと背景の穴埋めをガイドする。
  • 訓練パイプラインでは、画像からランダムに切り取った領域を用いてオブジェクトと背景のペアをシミュレートし、境界ボックスを監視として用いる。
  • 敵対的損失、存在確認損失(オブジェクトの存在を検証)、およびカット損失(完全なオブジェクトの削除を保証)を組み合わせた新しい損失関数を導入する。

実験結果

リサーチクエスチョン

  • RQ11つのディープジェネレーティブモデルが、境界ボックスの監視のみを用いて、同時にセグメンテーション、画像強調処理、背景の穴埋めを学習できるか?
  • RQ2これらの3つの操作を同時に学習させることで、個別に学習させる場合と比較して、セグメンテーションの正確性と画像品質が向上するか?
  • RQ3サイクル整合性損失は、生成画像の品質とセグメンテーションマスクのロバスト性にどのように影響するか?
  • RQ4境界ボックスによる弱い監視を用いた学習が、教師あり手法に近い性能をセグメンテーションと画像生成の両面で達成できるか、その程度はどの程度か?

主な発見

  • SEIGANは、COCOおよびCityscapesの両データセットで競争力ある平均交差率(mIoU)スコアを達成し、NoCycleベースラインを上回り、教師ありモデルに近づいた。
  • COCOでは、SEIGANのmIoUは0.762を達成した。これはNoCycleの0.723を上回り、教師ありベースラインの0.830に近い。
  • Cityscapesでは、SEIGANのmIoUは0.802を達成した。これはNoCycleの0.754を上回り、教師ありベースラインの0.867に近い。
  • 人間評価の結果、SEIGANは教師ありマスクがなくても、ベースライン手法よりも優れた知覚的品質の画像を生成することが確認された。
  • アブレーションスタディの結果、サイクル整合性損失の導入により、セグメンテーションの正確性と画像の現実性が顕著に向上した。
  • SEIGANは教師ありアノテーションが不要な状態で高品質なセグメンテーションマスクを生成でき、多様なデータセットへの汎用性が顕著に示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。