Skip to main content
QUICK REVIEW

[论文解读] WINE: Wavelet-Guided GAN Inversion and Editing for High-Fidelity Refinement

Chaewon Kim, Seungjun Moon|arXiv (Cornell University)|Oct 18, 2022
Advanced Image and Video Retrieval Techniques被引用 5
一句话总结

本文提出 WaGI,一种小波引导的 GAN 反演方法,通过引入小波损失和小波融合机制,显式保留图像的高频细节。通过解决标准 $L_2$ 损失固有的低频偏差问题,WaGI 在图像反演与编辑任务中均达到最先进性能,显著提升了边缘和纹理等精细细节的保真度。

ABSTRACT

Recent advanced GAN inversion models aim to convey high-fidelity information from original images to generators through methods using generator tuning or high-dimensional feature learning. Despite these efforts, accurately reconstructing image-specific details remains as a challenge due to the inherent limitations both in terms of training and structural aspects, leading to a bias towards low-frequency information. In this paper, we look into the widely used pixel loss in GAN inversion, revealing its predominant focus on the reconstruction of low-frequency features. We then propose WINE, a Wavelet-guided GAN Inversion aNd Editing model, which transfers the high-frequency information through wavelet coefficients via newly proposed wavelet loss and wavelet fusion scheme. Notably, WINE is the first attempt to interpret GAN inversion in the frequency domain. Our experimental results showcase the precision of WINE in preserving high-frequency details and enhancing image quality. Even in editing scenarios, WINE outperforms existing state-of-the-art GAN inversion models with a fine balance between editability and reconstruction quality.

研究动机与目标

  • 为解决现有 GAN 反演模型在高维特征操作下仍无法保留高频图像细节的长期问题。
  • 通过小波域分析,识别并分析广泛使用的 $L_2$ 损失在 GAN 反演中固有的低频偏差。
  • 提出一种新型 GAN 反演框架,通过频域监督显式处理高频子带。
  • 通过在反演与编辑过程中对高频分量实现精确控制,同时提升重建保真度与可编辑性。

提出的方法

  • 引入基于小波的损失项,放大高频子带(LH、HL、HH)上的重建误差,以在训练过程中优先保留这些分量。
  • 采用小波融合机制,在分层上采样过程中,直接将潜在空间中的高频特征传递至生成图像的小波系数。
  • 使用 SWAGAN 作为生成器架构,其天然支持基于小波的上采样,从而实现对小波系数的显式操作。
  • 应用离散小波变换(DWT)将输入图像与重建图像分解为低通(LL)和高通(LH、HL、HH)子带,实现频率感知的监督。
  • 使用多组件损失训练编码器,包括潜在差异上的 $L_1$ 损失($\Delta$)、图像重建上的 $L_2$ 损失($X$),以及在高频系数上的新型小波损失。
  • 通过频率感知监督实现编码器与生成器的端到端联合训练,确保从反演到编辑过程中高频细节得以保留。

实验结果

研究问题

  • RQ1为何现有高比率 GAN 反演模型即使使用更高维特征,仍无法保留高频图像细节?
  • RQ2标准 $L_2$ 损失在多大程度上偏向于重建低频分量,而牺牲高频细节?
  • RQ3通过小波变换实现显式频域监督,能否提升 GAN 反演的保真度,特别是对细粒度图像细节的保留?
  • RQ4小波融合如何增强高频特征从潜在空间到最终图像生成的传递?
  • RQ5所提出的基于小波引导的框架是否在图像反演与解耦编辑任务中均优于当前最先进基线方法?

主要发现

  • WaGI 在所有对比模型中实现了最低的 $L_2$ 重建误差(0.015)和最高的 SSIM(0.681),在图像反演任务中优于 HFGI 和 Restyle。
  • 与仅使用 $L_1$ 训练相比,小波损失使潜在差异 $\Delta$ 的 $L_1$ 误差降低了 17%,表明潜在空间对齐性能得到改善。
  • 与基线相比,小波融合使 $L_1$ 误差降低 7%,$L_2$ 误差提升 40%,证明了高频特征传递的有效性。
  • 定性结果表明,无论在反演还是编辑任务中,WaGI 均能更出色地保留如指甲颜色、文字、眼镜框等精细细节。
  • 使用 InterFaceGAN 和 StyleCLIP 进行编辑验证表明,WaGI 保持了身份一致性和细节稳定性,避免了 HFGI 及其他基线中常见的伪影与身份偏移。
  • 消融实验确认,小波损失与小波融合均为关键组件,其中小波融合对最终反演质量的提升最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。