[论文解读] Improved Techniques for GAN based Facial Inpainting
本文提出了一种基于 GAN 的面部修复方法,通过使用可学习的参数化网络实现更优的初始化,并引入时间平滑度损失以提升视频序列的重建质量与优化速度。该方法在 CelebA 和 VidTIMIT 数据集上实现了超过 15 倍的加速,且在无需显式人脸识别监督的情况下,显著提升了身份保持能力,优于当前最先进模型。
In this paper we present several architectural and optimization recipes for generative adversarial network(GAN) based facial semantic inpainting. Current benchmark models are susceptible to initial solutions of non-convex optimization criterion of GAN based inpainting. We present an end-to-end trainable parametric network to deterministically start from good initial solutions leading to more photo realistic reconstructions with significant optimization speed up. For the first time, we show how to efficiently extend GAN based single image inpainter models to sequences by a)learning to initialize a temporal window of solutions with a recurrent neural network and b)imposing a temporal smoothness loss(during iterative optimization) to respect the redundancy in temporal dimension of a sequence. We conduct comprehensive empirical evaluations on CelebA images and pseudo sequences followed by real life videos of VidTIMIT dataset. The proposed method significantly outperforms current GAN based state-of-the-art in terms of reconstruction quality with a simultaneous speedup of over 15$ imes$. We also show that our proposed model is better in preserving facial identity in a sequence even without explicitly using any face recognition module during training.
研究动机与目标
- 为解决单图设置下 GAN 面部修复因非凸优化导致的不稳定与收敛性差的问题。
- 通过建模时间动态并强制一致性,将单图 GAN 面部修复方法扩展至视频序列。
- 在不依赖训练过程中显式人脸识别模块的前提下,提升重建质量与优化速度。
- 证明仅使用时间平滑度损失即可有效保持序列中面部身份的一致性。
- 在伪序列与真实面部视频数据集(如 VidTIMIT)上验证所提方法的有效性。
提出的方法
- 提出一种可学习的参数化网络,以确定性方式初始化潜在码 $ z $,替代随机初始化,从而提升初始重建质量。
- 引入循环神经网络(LSTM),在时间窗口内的多帧中联合初始化潜在码,以捕捉场景动态。
- 实现时间平滑度损失,约束相邻帧的最终优化潜在码在欧氏空间中保持接近。
- 利用预训练的 GAN 生成器与判别器计算感知损失与上下文损失,优化过程由这些损失的加权和引导。
- 迭代应用优化框架以逐步优化潜在码 $ z $,最小化 $ L_{con}(z|I_d,M) + \eta L_{per}(z) $,新引入的组件显著提升收敛性。
- 在 VidTIMIT 数据上微调预训练的 CelebA GAN,以适应更低分辨率、真实世界面部视频的分布。
实验结果
研究问题
- RQ1与随机初始化相比,可学习的参数化初始化是否能提升基于 GAN 的面部修复在质量与速度上的表现?
- RQ2循环网络是否能有效用于视频序列中多帧的潜在码初始化,以提升时间一致性?
- RQ3在迭代优化过程中引入时间平滑度损失,是否能在无显式身份监督的情况下提升视频修复中的面部身份保持能力?
- RQ4所提组件在真实视频数据上的表现如何?其性能是否可泛化至合成伪序列之外?
- RQ5可学习初始化与时间平滑度损失的结合,在重建质量与优化速度方面,是否显著优于当前最先进方法?
主要发现
- 与基线方法 [7] 相比,该方法在 CelebA 与 VidTIMIT 数据集上实现了平均超过 15 倍的优化速度提升。
- 在 128×128 分辨率的 VidTIMIT 数据集上,所提模型(LSTM 初始化 + 平滑度损失)在 fjas0 受试者上的平均 PSNR 达到 27.78 dB,优于 [7] 的 25.81 dB。
- 在 128×128 分辨率下,上下文损失从 0.41 降低至 0.23,感知损失从 0.20 降低至 0.11,表明重建质量与真实感显著提升。
- 在 128×128 分辨率下,FaceNet 损失从 0.68 降低至 0.23,表明面部身份保持能力显著增强。
- 仅使用时间平滑度损失即可实现与使用显式身份监督模型相当的面部身份保持效果,证明其在隐式身份建模中的有效性。
- 在伪序列与真实视频上,该模型在视觉质量上均优于 [7],定性结果表明输出更具照片级真实感且时间上更一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。