Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Image-to-Image Translation via Pre-trained StyleGAN2 Network

Jialu Huang, Jing Liao|arXiv (Cornell University)|Oct 12, 2020
Generative Adversarial Networks and Image Synthesis参考文献 42被引用数 11
ひとこと要約

本稿では、事前学習済みのStyleGAN2モデルを用いた教師なし画像対画像変換手法を提案する。モデル変換と潜在空間の逆投影を活用することで、訓練リソースを大幅に削減しつつ、高品質で多様性に富み、意味的に忠実なドメイン間変換を実現する。本手法は、ソースドメインでの事前学習後、ターゲットドメインでの微調整のみを実施することで、画像の忠実度を維持し、モード崩壊を回避しながら最先端の性能を達成する。

ABSTRACT

Image-to-Image (I2I) translation is a heated topic in academia, and it also has been applied in real-world industry for tasks like image synthesis, super-resolution, and colorization. However, traditional I2I translation methods train data in two or more domains together. This requires lots of computation resources. Moreover, the results are of lower quality, and they contain many more artifacts. The training process could be unstable when the data in different domains are not balanced, and modal collapse is more likely to happen. We proposed a new I2I translation method that generates a new model in the target domain via a series of model transformations on a pre-trained StyleGAN2 model in the source domain. After that, we proposed an inversion method to achieve the conversion between an image and its latent vector. By feeding the latent vector into the generated model, we can perform I2I translation between the source domain and target domain. Both qualitative and quantitative evaluations were conducted to prove that the proposed method can achieve outstanding performance in terms of image quality, diversity and semantic similarity to the input and reference images compared to state-of-the-art works.

研究の動機と目的

  • 従来の教師なしI2I変換手法が抱える、高い計算コスト、訓練の不安定性、データの不均衡に起因するモード崩壊といった課題を解決すること。
  • ペairedデータやソース・ターゲット生成器の共同学習を必要とせず、複数ドメイン間での高品質な画像変換を可能にすること。
  • ソースドメインでの初期事前学習後、ターゲットドメインでの学習のみを実施することでリソース消費を削減すること。
  • 段階的なモデル変換を通じて、1つのベースモデルで複数ドメイン・複数モードの変換を実現すること。
  • 既存のSOTA手法と比較して、画像の忠実度、多様性、入力/参照画像との意味的類似性を向上させること。

提案手法

  • 本手法は、ソースドメインで事前学習済みのStyleGAN2生成器を出発点とし、保守的な微調整とレイヤー操作を用いてターゲットドメイン用の変換済み生成器を構築する。
  • モデル変換は T_X→Y(G_X) として定義され、G_Y = T_X→Y(G_X) となる。変換はターゲットドメインに限定され、品質と安定性の維持に寄与する。
  • 入力画像をその潜在コード z にマッピングする逆投影法を提案。これにより、変換済みターゲット生成器における z を介した変換が可能になる。
  • StyleGAN2の分離されたスタイル空間を活用し、特定のレイヤー(LS)を交換することで、ソースドメインとターゲットドメイン間の意味的整合性を向上させる。
  • サイクル整合性損失や双方向学習を回避することで、訓練の複雑さを軽減し、データが不均衡な状況下でもモード崩壊を防ぐ。
  • 完全結合層(FC)を固定した微調整戦略(FC-FT)を採用することで、生成器の構造的整合性を保ちつつ、新しいドメインに適応する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのStyleGAN2モデルを、共同学習を伴わず、モデル変換によって新たなターゲットドメインに効果的に適応できるか?
  • RQ2ソースドメインの画像から得た潜在空間の逆投影が、変換済みターゲットドメイン生成器に正確にマッピングされ、忠実な画像変換が達成できるか?
  • RQ3提案手法は、既存の教師なしI2I手法と比較して、画像品質、多様性、意味的類似性において優れているか?
  • RQ4従来手法と比較して、より少ないモデル数で複数ドメインの変換をサポートできるか?
  • RQ5モデル変換時のレイヤー交換が、意味的整合性と変換品質にどのように影響するか?

主な発見

  • 提案手法は、face2portraitタスクでFIDスコア32.480、face2animeタスクで52.930を達成し、CycleGAN(54.472および78.452)とMUNIT(62.683および66.261)を顕著に上回った。
  • レイヤー交換(アニメ用LS-3、ポートレート用LS-5)を適用した結果、face2animeタスクでLPIPS_sスコア0.468を記録し、入力画像との意味的類似性が優れたことを示した。
  • FC-FT-LSバージョンは、face2animeタスクでLPIPS_dスコア0.767を達成し、生成画像の多様性が優れていることを示した。
  • 逆投影ではSSIMスコア0.667を達成し、Image2StyleGAN(0.613)、IdInvert(0.623)、投影ベースライン(0.655)を上回った。
  • モデル距離メトリクスから、変換済みモデルがベースモデルに近い位置に位置していることが確認され、保守的な微調整とレイヤー操作の有効性が裏付けられた。
  • 本手法はドメインごとに1つのモデルで十分であり、4ドメイン間の任意のI2I変換を4つのモデルで実現可能であるのに対し、従来手法では6つのモデルが必要であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。