[论文解读] Make It So: Steering StyleGAN for Any Image Inversion and Editing
Make It So 提出了一种新颖的 GAN 反演方法,该方法在噪声空间(Z)中进行,而非潜在风格空间(W),从而实现了更高的反演精度和编辑一致性。通过联合优化潜在码 z 和生成器权重 θ′,该方法在反演精度上比 PTI 提高五倍,在编辑质量上提高十倍,同时利用单一在卧室图像上训练的 StyleGAN 模型,实现了对人脸、汽车和动物等分布外图像的泛化能力。
StyleGAN's disentangled style representation enables powerful image editing by manipulating the latent variables, but accurately mapping real-world images to their latent variables (GAN inversion) remains a challenge. Existing GAN inversion methods struggle to maintain editing directions and produce realistic results. To address these limitations, we propose Make It So, a novel GAN inversion method that operates in the $\mathcal{Z}$ (noise) space rather than the typical $\mathcal{W}$ (latent style) space. Make It So preserves editing capabilities, even for out-of-domain images. This is a crucial property that was overlooked in prior methods. Our quantitative evaluations demonstrate that Make It So outperforms the state-of-the-art method PTI~\cite{roich2021pivotal} by a factor of five in inversion accuracy and achieves ten times better edit quality for complex indoor scenes.
研究动机与目标
- 为解决真实世界图像中复杂场景(如室内房间)的准确且编辑一致的 GAN 反演挑战。
- 克服现有方法在 Z 空间中操作时为提升反演精度而牺牲编辑一致性的局限。
- 利用单一领域特定的 StyleGAN 模型,实现对人脸、动物和车辆等分布外图像的编辑方向泛化。
- 开发一种联合优化框架,同时学习潜在码 z 并自适应生成器权重 θ′,以提升反演保真度和编辑保留性。
- 证明在 Z 空间中使用锚点损失和支撑损失,即使在反演分布外图像时,也能保持语义编辑方向的稳定性。
提出的方法
- 该方法在噪声向量 z 和生成器权重 θ′ 上进行联合优化,以将真实图像反演到潜在空间,而非仅微调一个枢轴 w。
- 引入锚点损失,通过在不同图像的潜在空间中对齐编辑向量 s,以保持编辑方向的语义一致性。
- 使用支撑损失,确保对反演图像应用的编辑在语义上仍合理且逼真,即使输入为分布外图像。
- 采用改进的训练调度,延长迭代次数(最多 1000 次),以恢复细节并提升反演质量。
- 利用 StyleGAN 的固有图像先验,实现在无需微调或领域特定适配的情况下,对分布外图像实现零样本编辑。
- 通过在 Z 空间中操作,避免了精度与编辑一致性之间的权衡,因为 Z 空间中的编辑方向更稳定且可迁移。
实验结果
研究问题
- RQ1Z 空间中的 GAN 反演是否能显著优于 W 空间方法,在精度和编辑一致性方面均表现更优?
- RQ2对 z 和生成器权重 θ′ 的联合优化是否能带来比标准微调方法更鲁棒、更具泛化能力的反演与编辑性能?
- RQ3一个在单一领域(如卧室)上训练的 StyleGAN 模型,是否能成功反演并编辑分布外图像(如人脸、动物和汽车)?
- RQ4锚点损失和支撑损失在跨多样化图像分布时,如何共同作用以保持编辑语义的一致性?
- RQ5延长优化调度在复杂场景中,对提升反演保真度和细节恢复程度有多大影响?
主要发现
- Make It So 在感知损失和 L2 重建损失的测量下,反演精度比当前最先进方法 PTI 高五倍。
- 该方法在复杂室内场景中将编辑质量提升了十倍,实现了更逼真且语义一致的编辑效果,如重新布光和重新着色。
- 分布外图像(包括人脸、汽车和动物)可使用单一在卧室图像上训练的 StyleGAN 模型实现真实反演与编辑,这是以往方法所不具备的能力。
- 消融实验表明,锚点损失和支撑损失均不可或缺:任一损失的移除都会导致编辑一致性或反演质量下降,完整流程表现最佳。
- 使用延长优化(1000 次迭代)显著提升了细节恢复效果,尤其在高频区域(如台灯和纹理)表现突出。
- 在 Z 空间中通过权重自适应(θ′)进行联合优化,相比 W 空间方法,即使在反演与训练分布差异较大的图像时,也能更好地保持编辑方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。