[论文解读] Few-shot Image Generation via Cross-domain Correspondence
本文提出了一种少样本图像生成框架,通过一种新颖的距离一致性损失和基于锚点的逼真度正则化,将大规模源域中的跨域对应关系迁移至小规模目标域。通过在适应过程中保持图像之间的相对相似性,该方法即使仅使用10张训练图像,也能生成多样且逼真的样本,在照片级真实感和艺术性领域均优于先前方法。
Training generative models, such as GANs, on a target domain containing limited examples (e.g., 10) can easily result in overfitting. In this work, we seek to utilize a large source domain for pretraining and transfer the diversity information from source to target. We propose to preserve the relative similarities and differences between instances in the source via a novel cross-domain distance consistency loss. To further reduce overfitting, we present an anchor-based strategy to encourage different levels of realism over different regions in the latent space. With extensive results in both photorealistic and non-photorealistic domains, we demonstrate qualitatively and quantitatively that our few-shot model automatically discovers correspondences between source and target domains and generates more diverse and realistic images than previous methods.
研究动机与目标
- 解决在仅提供少量(例如10张)目标域图像时训练高质量生成模型的挑战。
- 通过从大规模源域迁移结构关系,克服少样本GAN训练中的过拟合与多样性不足问题。
- 在无需大规模标注数据的情况下,实现预训练GAN对新目标域的有效适应。
- 发现源分布与目标分布之间的有意义跨域对应关系,即使两域在语义上无关亦可。
提出的方法
- 提出一种跨域距离一致性损失,以保持源域与目标域中生成图像之间相对成对距离的一致性。
- 采用基于锚点的策略,在部分生成图像上施加图像级对抗损失(匹配真实训练样本),在其余图像上施加图像块级对抗损失,以平衡逼真度与多样性。
- 通过在距离一致性损失与逼真度正则化下微调预训练的源域GAN,实现无需完整网络重新训练的少样本适应。
- 利用潜在空间映射在域间发现噪声向量与生成图像之间的一一对应关系,实现类似风格迁移的生成。
- 利用大规模无标签源域(如FFHQ、Church、Cars)并通过结构对齐将其适配至小规模目标域(如漫画像、鬼屋、废弃汽车)。
- 利用预训练图像编码器(如Image2StyleGAN)评估重建质量并衡量域相关性。
实验结果
研究问题
- RQ1在仅提供10张训练图像的情况下,能否有效适应预训练GAN至新目标域,同时保持多样性与逼真度?
- RQ2在源域与目标域分布之间强制实施跨域距离一致性,是否能提升少样本图像生成性能?
- RQ3当源域与目标域在语义上相关或无关时,该方法表现如何?
- RQ4该模型在多大程度上能发现源域与目标域之间有意义的部件级或全局对应关系?
- RQ5训练图像数量(1-shot、5-shot、10-shot)如何影响生成样本的质量与多样性?
主要发现
- 所提方法即使仅使用10张训练图像,也显著优于先前的少样本GAN适应方法,在多样性与逼真度方面均有明显提升。
- 当源域与目标域在语义上相关时(如FFHQ → 漫画像),模型能发现清晰的一一对应关系,实现忠实的风格迁移。
- 在语义无关的设定下(如Cars → 漫画像),模型仍能发现部件级对应关系(如车轮对应眼睛),生成合理且多样的图像。
- 定量评估显示,当FFHQ、Church和Cars分别适配至漫画像、鬼屋和废弃汽车时,重建分数最佳(LPIPS < 0.3),表明域相关性较强。
- 随着训练数据增加(从1-shot到10-shot),生成图像的多样性与细节显著提升,10-shot结果展现出明确的身份特征与更丰富的结构。
- 基于锚点的逼真度正则化有效防止了过拟合,通过让大多数生成图像专注于图像块级逼真度,仅让一小部分图像紧密匹配真实训练样本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。