[论文解读] Feature-Style Encoder for Style-Based GAN Inversion
本文提出了一种特征-风格编码器,将风格化生成对抗网络潜在空间中的特征与风格表征解耦,实现在推理阶段无需优化即可实现高保真图像重建与鲁棒编辑。通过联合学习重建用的特征码和编辑用的潜在码,该方法在图像和视频重建任务中均达到当前最优性能,LPIPS降低50%,视频重建一致性更优。
We propose a novel architecture for GAN inversion, which we call Feature-Style encoder. The style encoder is key for the manipulation of the obtained latent codes, while the feature encoder is crucial for optimal image reconstruction. Our model achieves accurate inversion of real images from the latent space of a pre-trained style-based GAN model, obtaining better perceptual quality and lower reconstruction error than existing methods. Thanks to its encoder structure, the model allows fast and accurate image editing. Additionally, we demonstrate that the proposed encoder is especially well-suited for inversion and editing on videos. We conduct extensive experiments for several style-based generators pre-trained on different data domains. Our proposed method yields state-of-the-art results for style-based GAN inversion, significantly outperforming competing approaches. Source codes are available at https://github.com/InterDigitalInc/FeatureStyleEncoder .
研究动机与目标
- 解决现有GAN图像重建方法存在的感知质量差、重建误差高以及视频序列中不稳定的局限性。
- 开发一种端到端编码器,实现潜在空间中特征与风格表征的分离,以提升重建与编辑性能。
- 消除推理阶段的优化需求,实现快速且一致的图像与视频编辑。
- 提升对异常数据(如说话人脸视频中的非正面姿态)的泛化能力。
- 在高保真重建与有效编辑能力之间实现平衡的权衡。
提出的方法
- 模型采用双分支编码器结构:一个分支预测用于空间细节的特征码,另一个分支预测用于风格操控的潜在码。
- 特征码源自预训练StyleGAN2生成器的中间特征图,保留精细结构信息。
- 潜在码通过风格感知头预测,实现对妆容、眼睛颜色等外观属性的解耦编辑。
- 采用多尺度感知损失监督特征码,提升重建保真度。
- 模型通过联合损失端到端训练:在特征上使用感知损失,在生成图像上使用重建损失,并引入循环一致性损失以实现解耦。
- 训练过程中使用合成图像,以提升对分布外输入(如异常姿态)的鲁棒性与泛化能力。
实验结果
研究问题
- RQ1在潜在空间中分离特征与风格表征,是否能在无需推理阶段优化的情况下提升GAN图像重建质量?
- RQ2联合学习特征码与潜在码对重建保真度与编辑能力有何影响?
- RQ3所提出的编码器能否泛化至非正面姿态等复杂情况?
- RQ4多尺度感知监督与合成数据对重建性能有何影响?
- RQ5该方法在图像与视频任务中,与当前最优GAN图像重建模型相比,在定量与定性指标上表现如何?
主要发现
- 在FFHQ数据集上,该方法LPIPS得分为0.064,相比次优方法(pSp: 0.143)降低50%,较SOTA方法降低20%–50%。
- 在视频重建任务中,该方法SSIM为0.818,PSNR为26.64,LPIPS为0.122,在重建质量与感知质量上均优于所有基线方法。
- 消融实验证实,多尺度感知损失可提升感知质量(无该损失时FID为22.63,有则为19.03),且特征分支对保真度至关重要(无该分支时FID为35.28)。
- 在视频序列中,该模型在极端姿态下仍能保持身份一致性,而其他方法在非正面视角下失效。
- 训练阶段引入合成数据显著降低FID(有合成数据时为19.03,无时为20.45),表明泛化能力更强。
- 该方法支持快速、无需优化的推理,适用于实时视频编辑流水线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。