Skip to main content
QUICK REVIEW

[論文レビュー] UVCGAN v2: An Improved Cycle-Consistent GAN for Unpaired Image-to-Image Translation

D. Torbunov, Yi Huang|arXiv (Cornell University)|Mar 28, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

UVCGAN v2 は、ビジョントランスフォーマー(ViT)とスタイルドモディファイド畳み込みブロックを統合し、ディスクライミネータ設計を改善してモード崩壊を防止し、最新の GAN 訓練技術を適用することで、未対応画像間翻訳における著しい改善を達成したサイクル整合性のある GAN を提案する。CelebA-HQ Male-to-Female 翻訳タスクにおいて、最先端の拡散モデルよりも FID スコアで 40% の向上を達成し、GAN および DM ベースのモデルを上回る性能を発揮するとともに、標準的なピクセル単位の忠実度メトリクスの妥当性に疑問を呈する。

ABSTRACT

An unpaired image-to-image (I2I) translation technique seeks to find a mapping between two domains of data in a fully unsupervised manner. While initial solutions to the I2I problem were provided by generative adversarial neural networks (GANs), diffusion models (DMs) currently hold the state-of-the-art status on the I2I translation benchmarks in terms of Frechet inception distance (FID). Yet, DMs suffer from limitations, such as not using data from the source domain during the training or maintaining consistency of the source and translated images only via simple pixel-wise errors. This work improves a recent UVCGAN model and equips it with modern advancements in model architectures and training procedures. The resulting revised model significantly outperforms other advanced GAN- and DM-based competitors on a variety of benchmarks. In the case of Male-to-Female translation of CelebA, the model achieves more than 40% improvement in FID score compared to the state-of-the-art results. This work also demonstrates the ineffectiveness of the pixel-wise I2I translation faithfulness metrics and suggests their revision. The code and trained models are available at https://github.com/LS4GAN/uvcgan2

研究の動機と目的

  • 現在の未対応画像間翻訳モデルの限界、特にソースデータの非最適利用と拡散モデルにおける単純なピクセル単位の一貫性の依存を是正すること。
  • 未対応 I2I タスクに一般的に適用されていない現代的なアーキテクチャ的および訓練的進歩を統合することで、サイクル整合性 GAN の性能を向上させること。
  • 既存のピクセル単位の忠実度メトリクスの妥当性を疑問視し、知覚に整合する代替案を提示すること。
  • CelebA、CelebA-HQ、AFHQ を含む多様な翻訳ベンチマークで最先端の性能を達成すること。

提案手法

  • ビジョントランスフォーマー(ViT)とスタイルドモディファイド畳み込みブロックを組み合わせたハイブリッドニューラルアーキテクチャを導入し、特徴表現およびスタイルド・トランスファーを向上させる。
  • モード崩壊を軽減するための専用ヘッドをディスクライミネータに追加し、訓練の安定性と多様性を向上させる。
  • プログレッシブグローミング、スペクトル正規化、改善された勾配ペナルティを含む最新の GAN 訓練技術を未対応 I2I の文脈に適応して適用する。
  • 構造的忠実度を維持するため、最適化されたハイパーパramータ(λ_cyc=5, λ_GP=0.1, γ=100)を用いたサイクル整合性損失を組み込む。
  • 敵対的訓練の前に、生成器の自己教師付き事前学習ステージを導入し、収束性と品質を向上させる。
  • 知覚に整合する代替案を提示するため、忠実度メトリクスを再評価・再定義し、単純な L2 ピクセル単位の距離を越える。
Figure 5 : Examples of face landmark distance (Lm- $L_{2}$ ) between an input and a translated image. ( Appendix D )
Figure 5 : Examples of face landmark distance (Lm- $L_{2}$ ) between an input and a translated image. ( Appendix D )

実験結果

リサーチクエスチョン

  • RQ1最新のサイクル整合性 GAN アーキテクチャは、未対応画像間翻訳において最先端の拡散モデルを上回ることができるか?
  • RQ2最新の GAN 訓練技術は、サイクル整合性 I2I モデルの性能と安定性にどのように影響を与えるか?
  • RQ3標準的なピクセル単位の一貫性メトリクスは、人間の翻訳忠実度の知覚をどれほど正確に反映しているか?
  • RQ4ViT とスタイルドモディファイド畳み込みの組み合わせは、翻訳タスクにおける画像のリアリズムと意味的整合性を向上させるか?
  • RQ5見直された忠実度メトリクスは、人間の評価における翻訳品質とより良い整合性を示せるか?

主な発見

  • UVCGAN v2 は、CelebA-HQ Male-to-Female 翻訳タスクにおいて、最先端の拡散モデル EGSDE よりも FID スコアで 40% の向上を達成した。
  • 同じ CelebA Male-to-Female ベンチマークにおいて、元の UVCGAN と比較してリアリズムが 50% 以上向上した。
  • ピクセル単位の一貫性損失(L2)はトレードオフを引き起こす:λ_consist を高くするとピクセル単位の忠実度は向上するが、特に Cat-to-Dog のような複雑なタスクでは画像のリアリズムが著しく劣化する。
  • Cat-to-Dog 翻訳において、λ_consist が 0.2 を超えるとリアリズムが著しく低下するという、深刻な性能低下を示し、データセット依存の感受性を浮き彫りにした。
  • 本研究では、現在のピクセル単位の忠実度メトリクスが人間の知覚と整合しないことが判明し、知覚に整合する改善された代替案を提案した。
  • アブレーションスタディにより、最適なハイパーパramータ(λ_cyc=5, λ_GP=0.1, γ=100)が CelebA-HQ や AFHQ のような高品質データセットにおいて一貫していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。