Skip to main content
QUICK REVIEW

[論文レビュー] Few-shot Semantic Image Synthesis Using StyleGAN Prior

Yuki Endo, Yoshihiro Kanamori|arXiv (Cornell University)|Mar 27, 2021
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 7
ひとこと要約

本稿では、1つまたは5つのアノテート済みトレーニングペアのみを用いて、スパースまたは密なセマンティックレイアウトから高品質でフォトリッチな画像を生成する few-shot 画像生成手法を提案する。StyleGANの特徴量とセマンティッククラス間の最近傍特徴マッチングにより、偽のセマンティックマスクを生成し、最小限のラベル付きデータでエンコーダーを訓練することで、生成器を制御する。このアプローチにより、1ショット設定ですでに最先端の性能を達成し、レイアウトの忠実度と視覚的品質に優れた結果を得た。

ABSTRACT

This paper tackles a challenging problem of generating photorealistic images from semantic layouts in few-shot scenarios where annotated training pairs are hardly available but pixel-wise annotation is quite costly. We present a training strategy that performs pseudo labeling of semantic masks using the StyleGAN prior. Our key idea is to construct a simple mapping between the StyleGAN feature and each semantic class from a few examples of semantic masks. With such mappings, we can generate an unlimited number of pseudo semantic masks from random noise to train an encoder for controlling a pre-trained StyleGAN generator. Although the pseudo semantic masks might be too coarse for previous approaches that require pixel-aligned masks, our framework can synthesize high-quality images from not only dense semantic masks but also sparse inputs such as landmarks and scribbles. Qualitative and quantitative results with various datasets demonstrate improvement over previous approaches with respect to layout fidelity and visual quality in as few as one- or five-shot settings.

研究の動機と目的

  • ラベル付きトレーニングペアが非常に少ない状況下で、高品質でフォトリッチな画像をセマンティックレイアウトから生成する課題に対処すること。
  • ピixe-wiseセマンティックマスクのアノテーションコストを削減するため、ラベルなしデータと事前学習済みのStyleGANを活用すること。
  • 密なマスクだけでなく、ランドマークやスクリッチなどのスパース入力に対しても、few-shot状況下でセマンティック画像生成を可能にすること。
  • 複雑な損失関数やハイパーパramータチューニングを回避するため、偽ラベルデータに対する単純なL2損失を用いること。
  • セマンティックレイアウトと実画像のドメインギャップを埋めるために、セマンティッククラスからStyleGANの潜在空間へのマッピングを学習すること。

提案手法

  • 大規模なラベルなしデータセット(例:FFHQ、LSUN)上で事前学習済みのStyleGAN生成器を、セマンティック特徴空間の事前分布として活用する。
  • few-shotのラベル付き例における各セマンティッククラスごとに、StyleGANの中間層における平均特徴ベクトルを計算する。
  • ランダムノイズベクトルを潜在空間内で探索し、そのStyleGAN特徴量がクラス平均特徴量に最も近い近傍となるようにして、偽のセマンティックマスクを生成する。
  • 単純なL2損失を用いて、ランダムノイズを偽ラベル付きのセマンティックマスクと一致する潜在コードにマップするエンコーダーを学習する。
  • 学習済みエンコーダーを固定されたStyleGAN生成器と統合し、推論時においてセマンティックレイアウトによる制御を可能にする。
  • 密なマスクとスパース入力(例:ランドマーク、スクリッチ)を両方ともエンコーダーの入力としてのセマンティックレイアウトとして扱えるようにする。

実験結果

リサーチクエスチョン

  • RQ11つまたは5つのアノテート済みトレーニングペアでのみ、高忠実度のセマンティック画像生成が可能かどうか。
  • RQ2事前学習済みのStyleGAN生成器をどのように活用することで、セマンティック画像生成におけるラベル付きデータ不足を補うことができるか。
  • RQ3StyleGANの潜在空間から最近傍特徴マッチングにより生成された偽ラベル付きセマンティックマスクが、潜在的な不整合を伴っても高品質な画像生成を可能にするか。
  • RQ4本手法が、マスクよりも精度が低いランドマークやスクリッチといったスパース入力タイプに対しても一般化可能かどうか。
  • RQ5ピクセル単位のアライメントや非教師あり画像変換手法と比較して、few-shot制約下においてレイアウト忠実度と視覚的品質の両面で優れているか。

主な発見

  • 1ショット設定では、LSUN ChurchMaskでFréchet Inception Distance (FID) 65.1を達成し、同じラベル数のpSp (89.5) や pix2pixHD++ (100.6) よりも優れた性能を示した。
  • CelebAMask-HQでは、1ショット設定で平均交差率(mIoU)38.3を達成し、pSp (24.8) や pix2pixHD++ (38.7) より顕著に優れた性能を示した。
  • 全トレーニングセットを用いた場合でも、本手法はFID 56.9を達成し、pSp (76.2) よりも低く、偽サンプリングによるStyleGAN潜在空間のより良い探索を示した。
  • 5ショット設定では、FIDスコアがCelebALandmark-HQで82.1、LSUN ChurchMaskで77.4と、全ベースラインを上回り、一貫した性能を維持した。
  • スパース入力に対して高いロバスト性を示した:密なマスクの監視なしに、ランドマークやスクリッチからの画像生成に成功した。
  • 1ショット設定でCelebALandmark-HQにおけるランドマークアライメントのRMSEが31.5と低く、pSp (37.0) よりも優れており、より高いレイアウト忠実度を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。