[論文レビュー] Towards Diverse and Faithful One-shot Adaption of Generative Adversarial Networks
本稿では、1枚の参照画像のみを用いて事前学習済みGANが多様で高品質な画像を新しいドメインで生成できる、新規のワンショット生成的ドメイン適応手法DiFaを提案する。CLIPを用いたグローバルスタイルガイド、局所的詳細の整合性を図る注意型スタイル損失、およびW+潜在空間における選択的クロスドメイン一貫性を組み合わせることで、特に大きなドメインギャップがある状況でも、多様性と忠実性の両面で最先端の性能を達成する。
One-shot generative domain adaption aims to transfer a pre-trained generator on one domain to a new domain using one reference image only. However, it remains very challenging for the adapted generator (i) to generate diverse images inherited from the pre-trained generator while (ii) faithfully acquiring the domain-specific attributes and styles of the reference image. In this paper, we present a novel one-shot generative domain adaption method, i.e., DiFa, for diverse generation and faithful adaptation. For global-level adaptation, we leverage the difference between the CLIP embedding of reference image and the mean embedding of source images to constrain the target generator. For local-level adaptation, we introduce an attentive style loss which aligns each intermediate token of adapted image with its corresponding token of the reference image. To facilitate diverse generation, selective cross-domain consistency is introduced to select and retain the domain-sharing attributes in the editing latent $\mathcal{W}+$ space to inherit the diversity of pre-trained generator. Extensive experiments show that our method outperforms the state-of-the-arts both quantitatively and qualitatively, especially for the cases of large domain gaps. Moreover, our DiFa can easily be extended to zero-shot generative domain adaption with appealing results. Code is available at https://github.com/1170300521/DiFa.
研究の動機と目的
- 1枚の参照画像のみを用いて、事前学習済みGANが新しいドメインで多様で忠実な画像を生成する課題に対処すること。
- 既存のCLIPベース手法が局所的スタイルの詳細を保持できず、望ましくないドメイン共有属性のずれを引き起こすという限界を克服すること。
- 事前学習済みジェネレータの多様性を維持しつつ、参照画像からドメイン固有の属性やスタイルを忠実に取得すること。
- 参照画像が存在しないテキスト記述によるターゲットドメインへの効果的なゼロショットドメイン適応を可能にすること。
提案手法
- 参照画像のCLIP埋め込みとソースドメイン画像の平均CLIP埋め込みの差を用いて、グローバルレベルのドメイン適応をガイドする。
- 適応画像の途中層トーケンと、参照画像のCLIP画像エンコーダーの中間層における対応する最近傍トーケンを一致させる注意型スタイル(AS)損失を導入する。
- W+潜在空間における選択的クロスドメイン一貫性(SCC)を適用し、画像生成中にドメイン共有属性を特定・保持することで、事前学習済みジェネレータの多様性を保つ。
- StyleGANのインバージョンモデルを用いて、ソースドメインおよびターゲットドメインの画像をW+空間にマッピングし、ドメイン共有属性の方向を計算可能にする。
- 訓練目的を変更し、ドメイン共有属性において適応画像とソース画像の類似性を促進しつつ、ドメイン固有属性における変動を許容するようにする。
- AS損失を削除し、CLIP空間におけるテキストプロンプトをターゲットドメインの記述として用いることで、ゼロショットGDAにフレームワークを拡張する。
実験結果
リサーチクエスチョン
- RQ11枚の参照画像のみを用いて、ワンショットGDAで高多様性と忠実なスタイル転送を両立させるにはどうすればよいか?
- RQ2CLIPベースのグローバルガイドと注目型ローカルスタイル整合性が併用された場合、適応の忠実性はどの程度向上するか?
- RQ3W+空間におけるドメイン共有属性の選択的保持は、事前学習済みジェネレータの多様性を損なわず、ドメイン適応の質を維持できるか?
- RQ4参照画像が存在しないゼロショット環境において、本手法はどの程度効果的か?
- RQ5人間の顔から動物の彫刻へといった大規模なドメインギャップにおいて、本手法は一般化性能を十分に発揮できるか?
主な発見
- DiFaは、FIDやFID-100などの定量的指標および定性的な評価において、特に猫→トラのような大規模なドメインギャップにおいてもSOTA手法を上回る性能を発揮する。
- 注意型スタイル損失は局所的属性の忠実性を顕著に向上させ、参照画像からの髪の色や質感といった微細な詳細を忠実に捉えることを可能にする。
- 選択的クロスドメイン一貫性は、W+空間におけるドメイン共有属性の選択的保持により、事前学習済みジェネレータの多様性を効果的に保つことに成功した。
- 適応されたジェネレータは、ソースドメインからターゲットドメインへと編集方向(例:年齢、性別)を効果的に転送できることを示し、潜在空間の編集能力を保持している。
- 本手法はゼロショットGDAに対しても効果的に一般化され、FFHQからテキスト記述(例:「黒鉛筆のスケッチ」)のドメインに適応する際、StyleGAN-NADAよりも一貫性と多様性に優れた結果を生成する。
- アブレーションスタディにより、AS損失とSCC損失の両方が高い性能を達成するために不可欠であることが確認され、いずれの成分を欠損させるとFIDと視覚的品質が著しく低下する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。