[论文解读] Region-Based Semantic Factorization in GANs
该论文提出 ReSeFa,一种基于区域的生成对抗网络语义分解方法,可在无需标注或训练的情况下,发现潜在空间中对应于任意图像区域的解耦语义方向。通过将局部编辑建模为通过广义瑞利商求解的对偶优化问题,ReSeFa 实现了在多种 GAN 架构上的快速、鲁棒且精确的局部编辑,在控制精度、区域保真度和推理速度方面优于先前方法。
Despite the rapid advancement of semantic discovery in the latent space of Generative Adversarial Networks (GANs), existing approaches either are limited to finding global attributes or rely on a number of segmentation masks to identify local attributes. In this work, we present a highly efficient algorithm to factorize the latent semantics learned by GANs concerning an arbitrary image region. Concretely, we revisit the task of local manipulation with pre-trained GANs and formulate region-based semantic discovery as a dual optimization problem. Through an appropriately defined generalized Rayleigh quotient, we manage to solve such a problem without any annotations or training. Experimental results on various state-of-the-art GAN models demonstrate the effectiveness of our approach, as well as its superiority over prior arts regarding precise control, region robustness, speed of implementation, and simplicity of use.
研究动机与目标
- 解决现有 GAN 语义发现方法的局限性,即这些方法通常关注全局属性,或需要分割掩码来处理局部属性。
- 实现在预训练 GAN 中任意图像区域的精确、鲁棒且无需标注的局部语义因子发现。
- 将局部操作作为语义分解的先验,提升在多种 GAN 模型上的可控性和泛化能力。
- 消除对超参数或模型特定结构的依赖,确保方法的广泛适用性。
提出的方法
- 将基于区域的语义分解建模为基于像素输出对潜在码的雅可比矩阵的对偶优化问题。
- 将优化目标重述为广义瑞利商,从而通过特征分解实现高效求解。
- 仅需目标区域的粗略边界框,避免对详细分割掩码或标注的需求。
- 求解特征分解问题,以识别仅改变指定区域而保持图像其余部分不变的潜在方向。
- 将该方法应用于多种 GAN 模型,包括 StyleGAN2 和 BigGAN,且无需微调或重新训练。
- 利用 GAN 生成器雅可比矩阵的内在几何结构,确保区域特定的高保真编辑。
实验结果
研究问题
- RQ1我们能否在无需分割掩码或标注的情况下,发现对应于任意图像区域的 GAN 中解耦语义因子?
- RQ2我们如何确保鲁棒且精确的局部操作,同时保持目标区域外内容的完整性?
- RQ3我们能否通过统一的、无需训练的方法,在多种 GAN 架构上实现快速且可泛化的语义因子分解?
- RQ4与最先进的局部编辑基线方法(如 StyleSpace 和 LowRankGAN)相比,所提方法在性能和稳定性方面表现如何?
主要发现
- 在所有评估属性中,ReSeFa 在编辑后实现了最高的身份相似度(ID),表明其对整体面部结构的保留能力更优。
- 该方法在所有对比方法中具有最短的发现时间,归因于其高效的特征分解公式。
- 定量结果表明,非目标区域('out')的均方误差更低,证实了在编辑过程中对非目标内容的更好保留。
- ReSeFa 在视觉质量和定量指标上均优于 StyleSpace 和 LowRankGAN,尤其在最小化背景和周围区域的非预期变化方面表现更优。
- 该方法在多种 GAN 模型(包括 StyleGAN2 和 BigGAN)上均保持强大性能,展现出广泛的泛化能力。
- ReSeFa 能够成功闭合眼睛和嘴巴,且伪影极少,避免了基线方法中常见的下颌变形或背景颜色偏移等问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。