[论文解读] Expanding the Latent Space of StyleGAN for Real Face Editing
本文提出一种针对StyleGAN的双分支潜在空间扩展方法,通过将身份保持与解耦属性操作分离,提升了真实人脸图像的编辑质量。通过引入稀疏风格编辑和带对齐正则化的2D内容特征融合,该方法在最小化失真和提升属性解耦性的同时,实现了最先进的重建与编辑质量。
Recently, a surge of face editing techniques have been proposed to employ the pretrained StyleGAN for semantic manipulation. To successfully edit a real image, one must first convert the input image into StyleGAN's latent variables. However, it is still challenging to find latent variables, which have the capacity for preserving the appearance of the input subject (e.g., identity, lighting, hairstyles) as well as enabling meaningful manipulations. In this paper, we present a method to expand the latent space of StyleGAN with additional content features to break down the trade-off between low-distortion and high-editability. Specifically, we proposed a two-branch model, where the style branch first tackles the entanglement issue by the sparse manipulation of latent codes, and the content branch then mitigates the distortion issue by leveraging the content and appearance details from the input image. We confirm the effectiveness of our method using extensive qualitative and quantitative experiments on real face editing and reconstruction tasks.
研究动机与目标
- 解决使用预训练StyleGAN进行真实人脸图像编辑时,低失真重建与高可编辑性之间的权衡问题。
- 克服现有重建方法在语义编辑过程中难以保持身份与外观细节的局限性。
- 通过在风格码操作中引入稀疏性约束,实现解耦的、局部化的属性编辑。
- 通过将输入图像的2D内容特征融合进生成流程,降低编辑失真。
- 在无需微调生成器的前提下,实现对未见真实人脸的身份保持编辑,优于如PTI等先前方法。
提出的方法
- 提出双分支模型:风格分支通过1D风格码的稀疏性正则化实现解耦编辑,内容分支通过2D内容特征实现失真降低。
- 应用稀疏性正则化($/\mathcal{L}_{spa}$)以限制活跃风格码维度数量,实现局部化与解耦的属性编辑。
- 将从输入图像提取的2D内容特征整合进生成路径,以优化编辑效果并保留光照、表情、发型等图像特异性细节。
- 使用对齐损失($/\mathcal{L}_{align}$)监督源图像与生成图像之间的特征对齐,确保未编辑区域保持不变。
- 通过特征融合模块在多层融合风格与内容特征,结合全局语义控制与局部纹理保真度。
- 采用端到端训练方式,结合重建损失、稀疏性损失、对齐损失与感知损失,以优化图像保真度与可编辑性。
实验结果
研究问题
- RQ1我们能否通过单一、高效的推理流程,同时实现真实人脸图像编辑中的低失真重建与高可编辑性?
- RQ2对风格码操作施加稀疏性正则化,如何影响属性解耦性以及身份或外观的非预期变化?
- RQ3与标准潜在空间重建相比,输入图像中的2D内容特征在多大程度上提升了编辑保真度并降低了失真?
- RQ4对齐正则化是否能有效在属性编辑过程中保持非编辑区域(如背景、面部表情)的稳定性?
- RQ5与标准$/\mathcal{W}$或$/\mathcal{W+}$空间重建相比,通过引入额外内容特征扩展潜在空间是否能带来性能提升?
主要发现
- 消融实验中,所提方法在身份相似度(ID)上达到最高值0.77,显著优于基线配置。
- 在同时采用稀疏性正则化与对齐损失时,L2重建误差降低至0.028,LPIPS降低至0.09,表明图像保真度更优。
- 稀疏性正则化实现了真正的解耦编辑:编辑“眼镜”属性不会改变肤色或发型,显著减少非预期属性变化。
- 内容优化分支有效降低失真,生成图像在边缘锐度与细节(如皱纹、发丝)方面优于pSp与e4e。
- 定量结果表明,该方法在所有指标(LPIPS、L2、PSNR、SSIM)上均优于当前最先进方法,在重建任务中表现更优。
- 消融研究证实,若移除对齐损失,将导致颜色不准确,凸显其在保持外观细节中的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。