Skip to main content
QUICK REVIEW

[論文レビュー] Generative Hierarchical Features from Synthesizing Images

Yinghao Xu, Yujun Shen|arXiv (Cornell University)|Jul 20, 2020
Generative Adversarial Networks and Image Synthesis参考文献 72被引用数 4
ひとこと要約

本稿では、事前学習済みのStyleGAN生成器を学習損失関数として活用し、階層的エンコーダーを訓練することで、非常に転送可能な視覚的特徴を生成する新規手法、Generative Hierarchical Features (GH-Feat) を提案する。この手法は、画像編集、ハーモナイゼーション、分類、ランドマーク検出を含む、生成的および判別的タスクにおいて最先端の性能を達成し、再構成品質および特徴の転送可能性において、既存のGANベースの手法を上回っている。

ABSTRACT

Generative Adversarial Networks (GANs) have recently advanced image synthesis by learning the underlying distribution of the observed data. However, how the features learned from solving the task of image generation are applicable to other vision tasks remains seldom explored. In this work, we show that learning to synthesize images can bring remarkable hierarchical visual features that are generalizable across a wide range of applications. Specifically, we consider the pre-trained StyleGAN generator as a learned loss function and utilize its layer-wise representation to train a novel hierarchical encoder. The visual feature produced by our encoder, termed as Generative Hierarchical Feature (GH-Feat), has strong transferability to both generative and discriminative tasks, including image editing, image harmonization, image classification, face verification, landmark detection, and layout prediction. Extensive qualitative and quantitative experimental results demonstrate the appealing performance of GH-Feat.

研究の動機と目的

  • GANを用いた画像生成から学習された特徴が、分類を越えて多様なビジョンタスクに効果的に再利用可能かどうかを調査すること。
  • 既存のGANベースの特徴がしばしば高レベルの分類に限定されており、階層的かつ転送可能な表現を欠いているという限界を是正すること。
  • 事前学習済みのStyleGAN生成器のレイヤーごとの特徴と整合するように、階層的エンコーダーを設計し、特徴抽出を向上させること。
  • これらの特徴が、生成的および判別的下流タスクの両方において、どれほど一般化可能であるかを評価すること。

提案手法

  • 事前学習済みのStyleGAN生成器を、エンコーダー学習における学習損失関数として扱い、従来の再構成損失を置き換える。
  • 階層的エンコーダーを、同じ入力画像を入力した際に、StyleGAN生成器のレイヤーごとの活性化と一致する特徴マップを出力するように訓練する。
  • 生成器をImageNetで事前学習した後、固定した状態で維持し、その内部表現を監視信号として用い、敵対的および知覚的監視をエンコーダーの学習に適用する。
  • 特徴抽出はエンコーダーの「res 5」段階で実施し、その後、アダプティブ平均プーリングとベクトル化を経て、下流分類タスクに供する。
  • 生成器の内部表現を監視信号として用いることで、エンコーダーのエンドツーエンド学習を可能にする。
  • 本手法は、画像再構成およびスタイルミキシングをサポートしており、コンテンツとスタイルの階層的分離を実現している。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのGAN生成器が、汎用的視覚特徴エンコーダーの学習に効果的な学習損失関数として機能できるか。
  • RQ2本手法で抽出された特徴が、生成的および判別的応用を含む多様なビジョンタスクにどの程度転送可能か。
  • RQ3本手法のエンコーダーの階層的構造は、スタイル転送におけるアイデンティティおよびテクスチャの保持を、既存手法と比較してどのように向上させるか。
  • RQ4事前学習済み生成器を再利用することは、生成器とエンコーダーを同時にからくりから訓練するのと比較して、性能および効率性に優れるか。

主な発見

  • GH-Featは、ImageNetの画像再構成において、生成器とエンコーダーをからくりから学習するベースライン手法(FID: 46.20)を大きく上回るFID 18.48を達成した。
  • 平均二乗誤差(MSE)が0.0464、構造的類似性(SSIM)が0.558を記録し、優れた再構成品質を示した。
  • スタイルミキシングタスクでは、特に高レベル特徴のミキシングにおいて、ALAEよりもアイデンティティおよびポーズの保持が優れていた。
  • 画像分類タスクにおいても、BigBiGANなどの最先端手法と同等の性能を達成したが、より効率的かつ汎用的であった。
  • アブレーションスタディの結果、事前学習済み生成器を再利用することで、からくりからの共同学習に比べ、より高い性能と高速な収束が得られることを確認した。
  • 階層的特徴は、顔認証、ランドマーク検出、レイアウト予測を含む多様なタスクにおいて強く転送可能であり、従来のGANベースの特徴学習手法よりも一貫した改善を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。