[論文レビュー] Unsupervised Discovery of Disentangled Manifolds in GANs
本稿では、1-of-K属性ベクトルから潜在コードへの変換を学習し、中央値損失を適用して滑らかさと一貫性を向上させることで、事前学習済みのGANの潜在空間における分離可能で解釈可能な方向を教師なしで発見するフレームワークを提案する。本手法により、さまざまなデータセットおよびモデルで、改善された知覚的パス長と再構成精度を達成する属性固有の制御可能な画像編集が可能になる。
As recent generative models can generate photo-realistic images, people seek to understand the mechanism behind the generation process. Interpretable generation process is beneficial to various image editing applications. In this work, we propose a framework to discover interpretable directions in the latent space given arbitrary pre-trained generative adversarial networks. We propose to learn the transformation from prior one-hot vectors representing different attributes to the latent space used by pre-trained models. Furthermore, we apply a centroid loss function to improve consistency and smoothness while traversing through different directions. We demonstrate the efficacy of the proposed framework on a wide range of datasets. The discovered direction vectors are shown to be visually corresponding to various distinct attributes and thus enable attribute editing.
研究の動機と目的
- 事前学習済みのGANの潜在空間における分離可能で解釈可能な方向を、教師なしで発見し、制御可能な画像編集を可能にすること。
- 再訓練や教師信号を必要とせずに、GANの潜在空間における一貫性のない、滑らかでない属性操作の課題に対処すること。
- 新しい中央値に基づく正則化を用いて、同じ属性方向に属するすべての変位済み潜在コードが、その方向の学習済み中央値に近づくようにすることで、画像遷移の整合性と滑らかさを向上させること。
- 異なるデータセット(Anime Faces、ILSVRC-ImageNet、FFHQ)および事前学習済みモデル(SNGAN、BigGAN、StyleGAN2)の多様な環境で、本手法の有効性を検証すること。
提案手法
- 元の画像と2つの変位済み画像(連続する潜在ベクトルの加算によって生成)から、変位の方向とスケールを予測する変形ネットワーク $A$ を学習する。
- 再構成器 $R$ を用いて、元の画像と変位済み画像から属性ラベル $k$ と変位量 $\varepsilon$ を予測し、エンドツーエンドの学習を可能にする。
- 同じ属性方向 $k$ に属するすべての変位済み潜在コードが、その方向の学習済み中央値に近づくように促す中央値損失を導入する。
- 潜在空間(例:StyleGAN2の $W$-space)に変位済みコードを追加することで、再訓練なしに属性固有の編集が可能な事前学習済み生成器に本フレームワークを適用する。
- 対照学習と中央値正則化を組み合わせて、変形ネットワークと再構成器を同時に学習させ、分離性と一貫性を向上させる。
- 2段階の画像生成プロセスを採用する:まず $z$ から $z + A(k_1, \varepsilon_1)$ へ変位させ、次に $z + A(k_1, \varepsilon_1) + A(k_2, \varepsilon_2)$ へ変位させる。これにより、複数属性の遷移が可能になる。
実験結果
リサーチクエスチョン
- RQ1事前学習済みのGANの潜在空間において、教師なし・再訓練なしで、分離可能で解釈可能な方向を発見できるか?
- RQ2画像生成中の潜在空間における属性遷移の滑らかさと一貫性をどのように向上させられるか?
- RQ3中央値損失を導入することで、同じ属性に対応する潜在コードのクラスタリングが改善され、編集性が向上するか?
- RQ4本手法は、異なるデータセット(例:FFHQ、ILSVRC-ImageNet、Anime Faces)および異なる事前学習済みGANアーキテクチャ(BigGAN、StyleGAN2、SNGAN)に一般化可能か?
- RQ5ベースラインの教師なしGAN分離手法と比較して、本手法は知覚的品質と分離性をどの程度向上させるか?
主な発見
- BigGAN-FFHQにおいて、本手法は知覚的パス長(PPL)を99.78に達成し、ベースライン(179.23)よりも顕著に低く、より滑らかで知覚的に一貫性のある画像遷移を示している。
- ILSVRC-ImageNetデータセット(BigGAN)において、本手法は再構成器分類精度(RCA)を0.85に達成し、ベースライン(0.84)および中央値損失なしのアブレーション(0.86)を上回り、分離性の向上を示している。
- StyleGAN2を用いたFFHQにおいて、本手法はPPLが402.64、RCAが0.82を達成し、高解像度で複雑な顔生成においても一貫性のある性能を示している。
- 中央値損失により、潜在コードのクラス内分散が顕著に低減され、PPL値の低下と複数試行にわたる一貫性のある属性変化が確認された。
- 定性的な結果では、髪の色、髪型、眼鏡といった多様で意味的に意味のある属性が成功裏に発見され、方向間での滑らかな遷移が実現されている。
- Anime Faces、ILSVRC-ImageNet、FFHQにおいて、定量的指標と視覚的品質の両面で一貫した向上が確認され、異なるGANアーキテクチャおよびデータセットへの汎用性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。