Skip to main content
QUICK REVIEW

[论文解读] Mind the Gap: Domain Gap Control for Single Shot Domain Adaptation for Generative Adversarial Networks

Peihao Zhu, Rameen Abdal|arXiv (Cornell University)|Oct 15, 2021
Generative Adversarial Networks and Image Synthesis参考文献 38被引用 16
一句话总结

本文提出了一种新颖的单次域自适应方法,用于生成对抗网络(GANs),通过将域间差异建模为从域B中的参考图像到其在域A中的语义对应物的CLIP嵌入向量,从而提升图像视觉质量并减少过拟合。该方法利用II2S反演和新型正则化项,在保持身份和内容一致性的同时,实现细粒度的属性控制。

ABSTRACT

We present a new method for one shot domain adaptation. The input to our method is trained GAN that can produce images in domain A and a single reference image I_B from domain B. The proposed algorithm can translate any output of the trained GAN from domain A to domain B. There are two main advantages of our method compared to the current state of the art: First, our solution achieves higher visual quality, e.g. by noticeably reducing overfitting. Second, our solution allows for more degrees of freedom to control the domain gap, i.e. what aspects of image I_B are used to define the domain B. Technically, we realize the new method by building on a pre-trained StyleGAN generator as GAN and a pre-trained CLIP model for representing the domain gap. We propose several new regularizers for controlling the domain gap to optimize the weights of the pre-trained StyleGAN generator to output images in domain B instead of domain A. The regularizers prevent the optimization from taking on too many attributes of the single reference image. Our results show significant visual improvements over the state of the art as well as multiple applications that highlight improved control.

研究动机与目标

  • 解决单次域自适应中的过拟合与模式崩溃问题,因为现有方法过度模仿参考图像。
  • 仅使用一张参考图像,提升从域A到域B翻译图像的视觉保真度与身份一致性。
  • 通过更精确地建模域间差异,实现对属性迁移的细粒度控制。
  • 通过保持潜在空间结构,确保与目标域中现有图像编辑框架(如StyleFlow)的兼容性。
  • 开发一种计算高效的算法,可在单张GPU上于数分钟内运行,支持实际部署。

提出的方法

  • 以预训练的StyleGAN2生成器作为域A的基础生成器,并微调其以生成域B的图像。
  • 利用CLIP将域B的参考图像与域A中的对应图像嵌入到共享语义空间中。
  • 将域间差异建模为从域B的参考图像到其在域A中的语义对应物的向量(而非从域A的均值出发),从而减少过拟合。
  • 应用II2S反演技术,将域B的参考图像反向映射回域A,生成高质量的对应图像,以更准确地估计域间差异。
  • 引入多种新型正则化项——$L_{\text{ref\_clip}}$、$L_{\text{clip\_within}}$——以控制优化过程中参考图像属性的保留程度。
  • 采用改进的层选择策略与风格混合方法,提升生成图像的多样性与真实感。

实验结果

研究问题

  • RQ1我们能否通过将域间差异重新定义为从参考图像到其域A对应物的向量(而非从域A均值出发),来减少单次域自适应中的过拟合?
  • RQ2在仅使用一张参考图像的情况下,我们能在多大程度上保持源域图像的身份与内容,同时将风格迁移到新域?
  • RQ3与基于均值的向量相比,使用II2S反演生成对应图像在域间差异估计的质量与语义一致性方面有何提升?
  • RQ4我们能否在不重新训练编辑模型的前提下,实现对目标域中属性迁移(如姿态、光照、表情)的细粒度控制?
  • RQ5新型正则化项对单次GAN自适应中视觉质量与模式崩溃的影响如何?

主要发现

  • 用户偏好测试显示,本方法在视觉质量上获得73%的偏好得分,优于StyleGAN-NADA,且在77%的偏好得分上优于少样本基线,表明显著提升。
  • 80%的用户更倾向于本方法在域A中保留源图像的相似性,证实了过拟合减少与身份保留能力增强。
  • 91%的用户选择本方法作为在保持源图像相似性方面更优的方案,凸显其相比竞争方法显著减少了模式崩溃。
  • 消融实验表明,使用II2S生成对应图像,以及应用$L_{\text{ref\_clip}}$与$L_{\text{clip\_within}}$正则化项,能显著提升重建质量与风格迁移性能。
  • 使用StyleFlow在域B中进行图像编辑完全兼容,证明自适应后语义属性与潜在空间结构得以保留。
  • 该方法可在单张GPU上于数分钟内完成,尽管单次域自适应本身复杂度较高,但其仍具备实际应用的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。