[論文レビュー] Few-shot Image Generation via Cross-domain Correspondence
本稿では、新しい距離一貫性損失とアンカーベースの現実性正則化を用いて、大規模なソースドメインから小規模なターゲットドメインへとドメイン間の対応関係を転送する few-shot 画像生成フレームワークを提案する。適応過程で画像間の相対的類似度を保持することで、たとえ10枚のトレーニング画像しか利用しなくても、写真的リアリズムおよびアート分野の両面で先行手法を上回る多様で現実的なサンプルを生成する。
Training generative models, such as GANs, on a target domain containing limited examples (e.g., 10) can easily result in overfitting. In this work, we seek to utilize a large source domain for pretraining and transfer the diversity information from source to target. We propose to preserve the relative similarities and differences between instances in the source via a novel cross-domain distance consistency loss. To further reduce overfitting, we present an anchor-based strategy to encourage different levels of realism over different regions in the latent space. With extensive results in both photorealistic and non-photorealistic domains, we demonstrate qualitatively and quantitatively that our few-shot model automatically discovers correspondences between source and target domains and generates more diverse and realistic images than previous methods.
研究の動機と目的
- 少数(例:10枚)のターゲットドメイン画像しか入手できない状況で、高品質な生成モデルを訓練する課題に対処すること。
- 大規模なソースドメインからの構造的関係の転送により、few-shot GAN 訓練における過学習と多様性の欠如を克服すること。
- 大規模なラベル付きデータを必要とせずに、事前学習済み GAN を新しいターゲットドメインに効果的に適応可能にすること。
- ドメインが意味的に無関係であっても、ソースとターゲットの分布間で意味のある対応関係を発見すること。
提案手法
- 生成画像同士の相対的ペアワイズ距離を、ソースドメインおよびターゲットドメインの両方で一貫性を保つようにする、ドメイン間距離一貫性損失を導入する。
- 一部の生成画像(実際のトレーニングサンプルに類似するもの)に対しては画像レベルの敵対的損失を、残りの画像に対してはピクセルレベルの敵対的損失を適用するアンカーベース戦略を採用し、現実性と多様性のバランスを図る。
- 距離一貫性損失と現実性正則化を用いて事前学習済みソース GAN を微調整することで、ネットワークの完全再訓練を必要とせずに few-shot 適応を実現する。
- 潜在空間マッピングを用いて、ドメイン間のノイズベクトルと生成画像の1対1対応関係を発見し、スタイル転送に類似した生成を可能にする。
- 大規模かつラベルなしのソースドメイン(例:FFHQ, Church, Cars)を、構造的アライメントを通じて小規模なターゲットドメイン(例:風刺画、幽霊屋敷)に適応する。
- 再構成品質の評価とドメイン関連性の測定に、事前学習済みの画像エンコーダー(例:Image2StyleGAN)を活用する。
実験結果
リサーチクエスチョン
- RQ110枚のトレーニング画像しか利用できない状況でも、多様性とリアリズムを保持したまま、事前学習済み GAN を新しいターゲットドメインに効果的に適応できるか?
- RQ2ソースとターゲットの分布間にドメイン間距離一貫性を強制することで、few-shot 画像生成の性能が向上するか?
- RQ3ソースドメインとターゲットドメインが意味的に関連している場合と関連していない場合の両方で、本手法はどのように性能を発揮するか?
- RQ4モデルは、ソースとターゲットドメイン間で、部品レベルまたはグローバルレベルの意味のある対応関係をどの程度発見できるか?
- RQ5トレーニング画像の枚数(1-shot, 5-shot, 10-shot)が、生成サンプルの品質と多様性に与える影響はどの程度か?
主な発見
- 提案手法は、10枚のトレーニング画像しか利用しなくても、先行する few-shot GAN 適応手法よりも顕著に多様で現実的な画像を生成する。
- ソースとターゲットドメインが意味的に関連している場合(例:FFHQ → 風刺画)、モデルはソース画像とターゲット画像の間で明確な1対1対応関係を発見し、忠実なスタイル転送を可能にする。
- 意味的に無関係なドメイン設定(例:Cars → 風刺画)でも、部品レベルの対応関係(例:車輪が目に対応)を発見し、妥当で多様な生成を実現する。
- 定量的評価では、FFHQ, Church, Cars がそれぞれ風刺画、幽霊屋敷、放置された車に適応された際、再構成スコアが LPIPS < 0.3 を達成しており、強いドメイン関連性を示している。
- トレーニングデータの増加に伴い(1-shot から 10-shot へ)、生成画像の多様性と詳細さが顕著に向上し、10-shot の結果では明確な個体差と洗練された構造が観察される。
- アンカーベースの現実性正則化は、多くの生成画像がピクセルレベルの現実性に注力できる一方で、一部の画像のみが実際のトレーニングサンプルに密接に一致するようにすることで、過学習を効果的に防止する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。