Skip to main content
QUICK REVIEW

[論文レビュー] Learning Foreground-Background Segmentation from Improved Layered GANs

Yang Yu, Hakan Bilen|arXiv (Cornell University)|Apr 1, 2021
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

本論文では、潜在コードと生成画像/マスクの相互情報量を最大化することで、前景と背景を分離する改良型レイヤード GAN を提案する。これにより、高品質なペアド画像およびセグメンテーションマスクの合成が可能となる。本手法は、分析・合成フレームワークを用いて、GAN とセグメンテーションネットワークを交互に訓練することで、CUB、Cars、Dogs、APC データセットにおいて、教師なし前景・背景分離の最先端性能を達成する。

ABSTRACT

Deep learning approaches heavily rely on high-quality human supervision which is nonetheless expensive, time-consuming, and error-prone, especially for image segmentation task. In this paper, we propose a method to automatically synthesize paired photo-realistic images and segmentation masks for the use of training a foreground-background segmentation network. In particular, we learn a generative adversarial network that decomposes an image into foreground and background layers, and avoid trivial decompositions by maximizing mutual information between generated images and latent variables. The improved layered GANs can synthesize higher quality datasets from which segmentation networks of higher performance can be learned. Moreover, the segmentation networks are employed to stabilize the training of layered GANs in return, which are further alternately trained with Layered GANs. Experiments on a variety of single-object datasets show that our method achieves competitive generation quality and segmentation performance compared to related methods.

研究の動機と目的

  • 高価な人手によるセグメンテーションマスクに依存するのを減らし、自動的にペアド画像とマスクを合成すること。
  • 教師なし条件下でのレイヤード GAN における自明な分解(例:すべて前景またはすべて背景)を解消すること。
  • 潜在コードと生成コンテンツ間の相互情報量の最大化により、前景と背景の分離を向上させること。
  • GAN が生成する合成データを用いて、セグメンテーションネットワークのエンドツーエンド訓練を可能とすること。
  • セグメンテーションネットワークからのフィードバックにより GAN 訓練を安定化させ、相乗的に改善するループを構築すること。

提案手法

  • レイヤード GAN アーキテクチャが、共有の「パブリック」コードと前景専用の「プライベート」コードの2つの別個の潜在コードから、背景と前景を生成する。
  • 合成画像とプライベート潜在コード間の相互情報量を最大化することで、多様で意味のある前景生成を促進する。
  • 前景マスクとプライベートコード間の相互情報量も最大化し、意味的整合性を保証する。
  • 合成過程で摂動を適用することで、自明な全前景分解を罰する。これにより、ロバストネスが向上する。
  • セグメンテーションネットワークは合成データで訓練され、交互に訓練される過程で GAN を正則化するために用いられる。
  • 分析・合成アプローチを採用しており、セグメンテーション性能が GAN の分離性を向上させるとともに、逆に GAN の分離性がセグメンテーション性能を向上させるという相互改善の仕組みとなっている。

実験結果

リサーチクエスチョン

  • RQ1潜在コードと生成画像の間の相互情報量の最大化は、レイヤード GAN における前景・背景分離を改善できるか?
  • RQ2このような GAN が生成する合成画像・マスクペアは、人手によるアノテーションなしで競争力のある分離性能を達成できるか?
  • RQ3セグメンテーションネットワークからのフィードバックは、レイヤード GAN 訓練の安定性と品質を向上させるか?
  • RQ4本手法は、実世界のデータセットにおいて、VAEベースおよび先行する GAN ベースの教師なし分離手法と比較してどのように性能を発揮するか?
  • RQ5本手法は、単一オブジェクトベンチマークにとどまらず、マルチカテゴリデータセットにも一般化可能か?

主な発見

  • CUB データセットでは、81.7% の mIoU を達成し、PerturbGAN(38.0% mIoU)を大きく上回り、Melas-Kyriazi ら(66.4% IoU)を 3.3 ポints 上回った。
  • CUB では 94.3% の精度と 69.7% の IoU を達成し、最先端の教師なし手法と同等の性能を示した。
  • APC データセットでは FID スコアが 103.9 であり、GENESIS-V2(245.6)と比べて顕著に低く、画像生成品質が優れていることを示している。
  • 定性的な結果では、特に複雑な実世界画像において、GENESIS-V2 よりも細かく正確なセグメンテーションマスクが得られている。
  • 本手法は単一オブジェクトデータセットにとどまらず、APC においてもマルチカテゴリ画像の生成とセグメンテーションに成功している。
  • アブレーションスタディの結果、相互情報量の最大化が、全背景や自明な分解を抑制する上で不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。