[论文解读] LaFIn: Generative Landmark Guided Face Inpainting
LaFIn 提出了一种利用面部关键点作为结构先验的生成式人脸修复方法,以提升真实感和属性一致性。该方法采用双流网络结构:一个关键点预测分支用于估计人脸拓扑与表情,一个基于 U-Net 的修复分支则以预测的关键点作为条件,实现了在 CelebA-HQ 和 CelebA 数据集上的最先进性能,中心遮挡下 FID 得分为 4.98,随机遮挡下为 5.31。
It is challenging to inpaint face images in the wild, due to the large variation of appearance, such as different poses, expressions and occlusions. A good inpainting algorithm should guarantee the realism of output, including the topological structure among eyes, nose and mouth, as well as the attribute consistency on pose, gender, ethnicity, expression, etc. This paper studies an effective deep learning based strategy to deal with these issues, which comprises of a facial landmark predicting subnet and an image inpainting subnet. Concretely, given partial observation, the landmark predictor aims to provide the structural information (e.g. topological relationship and expression) of incomplete faces, while the inpaintor is to generate plausible appearance (e.g. gender and ethnicity) conditioned on the predicted landmarks. Experiments on the CelebA-HQ and CelebA datasets are conducted to reveal the efficacy of our design and, to demonstrate its superiority over state-of-the-art alternatives both qualitatively and quantitatively. In addition, we assume that high-quality completed faces together with their landmarks can be utilized as augmented data to further improve the performance of (any) landmark predictor, which is corroborated by experimental results on the 300W and WFLW datasets.
研究动机与目标
- 解决在大范围遮挡、姿态变化、表情差异和身份多样的情况下的真实感人脸修复挑战。
- 克服先前方法依赖边缘或语义分割图的局限性,这些方法易受误差和冗余影响。
- 提升修复人脸的结构保真度与属性一致性(如性别、种族、表情等)。
- 证明通过预测关键点生成的高质量人脸可作为有效的数据增强手段,用于提升关键点检测性能。
- 在基准人脸数据集上,实现定性和定量评估的优越性能。
提出的方法
- 采用两阶段深度学习框架:一个面部关键点预测子网络和一个条件化图像修复子网络。
- 使用基于 U-Net 的生成器,结合空洞残差块与长短时记忆注意力机制,以增强长距离空间依赖关系的特征聚合。
- 通过预测的关键点条件化修复网络,引导生成语义一致且逼真的面部纹理。
- 在生成器和判别器网络中集成实例归一化与谱归一化,以稳定训练过程。
- 采用多尺度判别器,结合谱归一化与 Leaky ReLU,以优化对抗损失。
- 通过生成具有预测关键点的合成高质量人脸修复结果,对 300W 和 WFLW 数据集上的关键点检测器进行微调,实现数据增强。
实验结果
研究问题
- RQ1与边缘或语义分割图相比,面部关键点是否能作为更鲁棒、更有效的结构先验用于人脸修复?
- RQ2在修复网络中引入预测关键点作为条件,能在多大程度上提升真实感与属性一致性?
- RQ3能否利用生成的、关键点准确的高质量人脸修复结果,来提升现有关键点检测模型的性能?
- RQ4在不同遮挡模式下,该方法在 FID、LPIPS 和感知质量方面与最先进方法相比表现如何?
- RQ5该模型在大范围遮挡以及姿态、表情、种族等多样化面部属性下是否具备良好的泛化能力?
主要发现
- LaFIn 在 CelebA-HQ 数据集上中心遮挡下的 FID 得分为 4.98,相较于 PIC 及其他 SOTA 方法,在分布相似性方面表现更优。
- 在随机遮挡下,模型 FID 得分为 5.31,表明其对不规则遮挡模式具有强大的鲁棒性。
- 定性结果表明,LaFIn 更有效地保留了拓扑结构(如眼睛、鼻子、嘴巴)与属性一致性(如姿态、表情、种族)。
- 该方法显著减少了因结构不一致导致的感知缺陷,尤其在大范围遮挡区域表现更优。
- 所提出的数据增强策略显著提升了在 300W 和 WFLW 数据集上的关键点检测性能,验证了生成人脸作为合成训练数据的实用性。
- 消融实验表明,关键点条件化比边缘或语义分割图监督更有效,因其提供了紧凑而信息丰富的结构先验。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。