[论文解读] Bridging CLIP and StyleGAN through Latent Alignment for Image Editing
本文提出 CSLA,一种无需数据的方法,通过潜在空间对齐在 CLIP 与 StyleGAN 之间建立桥梁,实现无需推理时优化、多样化文本驱动的图像编辑。通过映射具有时间相对一致性的潜在残差以及自适应风格混合,该方法在不依赖额外训练数据或测试时优化的情况下,实现了高保真度、身份保持的编辑效果与文本到图像生成。
Text-driven image manipulation is developed since the vision-language model (CLIP) has been proposed. Previous work has adopted CLIP to design a text-image consistency-based objective to address this issue. However, these methods require either test-time optimization or image feature cluster analysis for single-mode manipulation direction. In this paper, we manage to achieve inference-time optimization-free diverse manipulation direction mining by bridging CLIP and StyleGAN through Latent Alignment (CSLA). More specifically, our efforts consist of three parts: 1) a data-free training strategy to train latent mappers to bridge the latent space of CLIP and StyleGAN; 2) for more precise mapping, temporal relative consistency is proposed to address the knowledge distribution bias problem among different latent spaces; 3) to refine the mapped latent in s space, adaptive style mixing is also proposed. With this mapping scheme, we can achieve GAN inversion, text-to-image generation and text-driven image manipulation. Qualitative and quantitative comparisons are made to demonstrate the effectiveness of our method.
研究动机与目标
- 解决现有文本驱动图像编辑方法效率低下的问题,这些方法需要在推理时进行优化或聚类分析以挖掘操纵方向。
- 克服 CLIP 与 StyleGAN 潜在空间之间知识分布偏差的问题,该偏差在直接映射潜在变量时会导致编辑结果失真。
- 通过无数据方式训练潜在映射器,实现在无需额外数据或推理时计算的情况下,支持任意且多样的操纵模式。
- 通过统一的潜在对齐框架,支持多种下游任务——GAN 反演、文本到图像生成以及文本驱动编辑。
提出的方法
- 提出一种无数据训练策略,用于训练将 CLIP 空间潜在变量映射到 StyleGAN 的 w 和 s 空间的潜在映射器,避免对外部数据集的依赖。
- 引入潜在残差映射:不直接映射完整潜在变量,而是映射相对于参考图像的差异(Δf_I),以减少分布偏差。
- 应用时间相对一致性(TRC)动态选择 CLIP 空间中的操纵中心,最小化 CLIP 与 StyleGAN 之间的知识分歧。
- 设计自适应风格混合(ASM)模块,学习 s 空间中的调制信号以优化 Δs,从而提升图像保真度。
- 利用 CLIP 的图像和文本编码器,通过将文本嵌入投影到 StyleGAN 潜在空间,实现 GAN 反演与文本条件图像生成。
- 采用对比损失端到端训练系统,对齐 CLIP 与 StyleGAN 的表征,实现对未见文本提示的零样本泛化能力。
实验结果
研究问题
- RQ1我们能否在保持高质量、多样化操纵方向的前提下,消除文本驱动图像编辑中对推理时优化的需求?
- RQ2CLIP 与 StyleGAN 潜在空间之间的知识分布偏差如何影响编辑保真度?是否可通过基于残差的映射加以缓解?
- RQ3时间相对一致性是否通过动态选择操纵中心,提升潜在映射的鲁棒性与准确性?
- RQ4自适应风格混合是否能通过优化 s 空间中的生成潜在代码,提升图像质量与文本提示的一致性?
- RQ5统一的潜在对齐框架在无需额外数据或微调的情况下,能在多大程度上支持 GAN 反演、文本到图像生成与编辑?
主要发现
- 所提出的 CSLA 方法在文本驱动图像编辑任务中达到最先进性能,在定性与定量评估中均优于 StyleCLIP-optim 与 StyleMC。
- 在人脸身份度量(ArcFace)方面,CSLA 在眼镜修改任务中得分达 0.82,显著高于 StyleCLIP-optim(0.62)与 StyleMC(0.69)。
- 在文本一致性(CLIP 零样本准确率)方面,CSLA 在眼镜任务中达 0.65,微笑任务中达 0.99,年龄修改任务中达 0.56,全面超越两种基线方法。
- 消融实验表明,使用 Δs 映射器可提升文本一致性,ASM 模块可增强图像保真度,而 TRC 进一步优化结果,尤其在细粒度属性(如‘假发’与‘麦克风’)上表现显著。
- 该方法实现无需测试时优化的快速推理,推理速度处于 SOTA 方法的顶尖水平,同时支持任意操纵模式。
- CSLA 仅使用 CLIP 的编码器即成功支持 GAN 反演与文本到图像生成,充分证明了该框架的通用性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。