[论文解读] Mask-Guided Discovery of Semantic Manifolds in Generative Models
本文提出一种基于掩码引导的优化方法,用于在 StyleGAN2 等生成模型的潜在空间中发现平滑且局部化的语义流形。通过使用感知损失和弹簧型正则化,该方法生成一系列潜在向量,可产生逼真且区域特定的面部变化,从而实现无需标注数据或模型修改的可控动画与解耦操作。
Advances in the realm of Generative Adversarial Networks (GANs) have led to architectures capable of producing amazingly realistic images such as StyleGAN2, which, when trained on the FFHQ dataset, generates images of human faces from random vectors in a lower-dimensional latent space. Unfortunately, this space is entangled - translating a latent vector along its axes does not correspond to a meaningful transformation in the output space (e.g., smiling mouth, squinting eyes). The model behaves as a black box, providing neither control over its output nor insight into the structures it has learned from the data. We present a method to explore the manifolds of changes of spatially localized regions of the face. Our method discovers smoothly varying sequences of latent vectors along these manifolds suitable for creating animations. Unlike existing disentanglement methods that either require labelled data or explicitly alter internal model parameters, our method is an optimization-based approach guided by a custom loss function and manually defined region of change. Our code is open-sourced, which can be found, along with supplementary results, on our project page: https://github.com/bmolab/masked-gan-manifold
研究动机与目标
- 揭示生成模型潜在空间中与局部面部属性变化相对应的平滑、有意义的流形。
- 在无需标注数据的情况下,实现用户可控的、局部化的生成人脸操作(例如,嘴部形状、眼部表情等)。
- 通过遍历这些语义流形,提供一种生成高质量、平滑动画的方法。
- 以可解释且可控的方式探索解耦面部变化的几何结构。
- 为现有依赖监督信号或架构修改的解耦方法提供一种无需访问模型内部结构的、基于优化的黑箱替代方案。
提出的方法
- 定义一个区域特定的损失函数 ℒ_X,通过感知距离或 L2 距离最小化掩码区域(例如嘴部)内的差异,同时保持面部其余部分不变。
- 使用用户提供的初始潜在向量 z* 和矩形掩码 M,隔离目标面部区域以进行操作。
- 应用基于弹簧的正则化损失 ℒ_spring,以确保潜在向量序列中相邻向量之间的过渡平滑。
- 使用二阶弹簧约束(k=1,2)以最小化曲率,并在潜在空间路径上保持均匀间距。
- 使用 L-BFGS 优化完整目标函数,寻找最小化组合损失 αℒ_X + βℒ_spring(k=1) + γℒ_spring(k=2) 的潜在向量序列 Z。
- 最终在潜在空间中生成的路径在通过生成器解码后,可产生视觉上平滑且局部化的面部动画。
实验结果
研究问题
- RQ1我们能否在不依赖标注数据的情况下,从预训练 GAN 的潜在空间中发现平滑且局部化的语义流形?
- RQ2如何引导优化过程,以确保仅特定面部区域发生变化,而其余面部区域保持稳定?
- RQ3基于弹簧的正则化在在多大程度上能生成视觉上平滑且自然的面部动画?
- RQ4该方法是否能泛化到不同的初始人脸图像和任意掩码区域?
- RQ5在操作过程中,感知距离与像素级距离相比,在保持语义一致性方面有何影响?
主要发现
- 该方法成功生成了局限于掩码区域的平滑、局部化面部变化,非掩码区域的失真极小。
- 使用感知损失(LPIPS)相比 L2 距离能产生更自然的过渡效果,尤其在面部纹理和结构方面表现更优。
- 弹簧正则化有效生成了低曲率、间距均匀的潜在空间路径,从而支持高质量动画生成。
- 该方法在多种初始人脸图像和掩码区域上均表现出良好的泛化能力,补充材料中已通过多个示例验证。
- 优化过程在不修改模型权重或依赖属性标注的情况下,成功发现了有意义的语义流形。
- 该方法实现了类似木偶戏的面部属性控制,例如通过无约束、用户自定义的掩码实现对嘴部形状和眼部表情的精确操控。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。