[论文解读] GAN Inversion for Image Editing via Unsupervised Domain Adaptation
本文提出 UDA-Inversion,一种新颖的无监督 GAN 反演方法,利用无监督域适应(UDA)在无配对高分辨率(HQ)参考图像的情况下,实现对低质量(LQ)图像的重建与编辑。通过将 HQ 图像视为源域,LQ 图像视为未标记的目标域,该方法在潜在空间中同时最小化重建误差与域差异,实现在多个数据集上与监督方法相当的性能。
Existing GAN inversion methods work brilliantly in reconstructing high-quality (HQ) images while struggling with more common low-quality (LQ) inputs in practical application. To address this issue, we propose Unsupervised Domain Adaptation (UDA) in the inversion process, namely UDA-inversion, for effective inversion and editing of both HQ and LQ images. Regarding unpaired HQ images as the source domain and LQ images as the unlabeled target domain, we introduce a theoretical guarantee: loss value in the target domain is upper-bounded by loss in the source domain and a novel discrepancy function measuring the difference between two domains. Following that, we can only minimize this upper bound to obtain accurate latent codes for HQ and LQ images. Thus, constructive representations of HQ images can be spontaneously learned and transformed into LQ images without supervision. UDA-Inversion achieves a better PSNR of 22.14 on FFHQ dataset and performs comparably to supervised methods.
研究动机与目标
- 解决现有方法在缺乏配对高分辨率(HQ)参考图像的情况下,对真实世界低质量(LQ)图像进行 GAN 反演的挑战。
- 克服监督 GAN 反演方法依赖于配对 HQ-LQ 数据的局限性,而此类数据在真实场景中往往不可用。
- 仅使用预训练的 GAN 和未标记的 LQ 数据,实现对 LQ 图像的高保真重建与语义编辑。
- 利用无监督域适应(UDA)在潜在空间中将知识从源域(HQ 图像)迁移到目标域(LQ 图像)。
- 证明 HQ 图像的构建性表征可自发地被学习并适配到 LQ 图像上,而无需直接监督。
提出的方法
- 在无监督域适应(UDA)的背景下,将高分辨率(HQ)图像视为源域,低质量(LQ)图像视为未标记的目标域。
- 将反演问题表述为最小化源域重建误差以及潜在空间中源域与目标域分布之间的差异。
- 引入一个差异函数 $ d_{s,t} $,用于度量潜在空间中源域与目标域之间的分布差异。
- 通过最小化一个结合了源域重建误差与域差异 $ d_{s,t} $ 的泛化界来优化编码器,从而确保潜在码学习的鲁棒性。
- 使用预训练的 StyleGAN 生成器,通过反演的潜在码实现图像重建与编辑,支持通过潜在空间操作实现语义编辑。
- 应用理论保证(定理 1)表明,目标域重建误差的上界由源域误差与域差异共同决定,从而为优化目标提供理论依据。
实验结果
研究问题
- RQ1无监督域适应能否在无配对高分辨率参考图像的情况下,有效应用于低质量图像的 GAN 反演?
- RQ2源域(HQ 图像)的知识在多大程度上可被迁移到目标域(LQ 图像)以实现准确的重建与编辑?
- RQ3所提出的 UDA-Inversion 方法在图像重建与编辑保真度方面,与监督及无监督基线相比,在定量与定性上表现如何?
- RQ4域差异项 $ d_{s,t} $ 对 LQ 图像上反演模型的鲁棒性与性能有何贡献?
- RQ5该模型是否能在多个领域(如 FFHQ、Stanford Cars)之间泛化,同时在无监督条件下保持高质量的编辑与重建能力?
主要发现
- 尽管缺乏配对 HQ-LQ 数据,UDA-Inversion 在 FFHQ 与 Stanford Cars 数据集上实现的图像重建与编辑性能与监督方法相当。
- 在 FFHQ 数据集上,UDA-Inversion 在 HQ 图像反演的 PSNR、SSIM 和 MSE 指标上优于两个基线模型,且在 LQ 图像重建中保持了相近的 FID 与 SSIM 分数。
- 在汽车数据集中,UDA-Inversion 在 FID 指标上始终优于基线模型,其他指标也接近基线水平,表明其对域偏移具有强鲁棒性。
- 编辑任务的定量评估显示,UDA-Inversion 在源域编辑的 FID 指标上优于基线,且在目标域中也取得了具有竞争力的结果,尤其在 'Pose' 属性编辑方面表现突出。
- 消融研究证实,若移除域差异项 $ d_{s,t} $,则在重建细节(如遮罩)方面会出现显著失败,证明其在稳定 LQ 图像反演中的关键作用。
- 定性结果表明,UDA-Inversion 生成的编辑结果视觉上最令人满意,畸变更少,语义变化更一致,优于 E2Style 与 HFGI 等基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。