[论文解读] DeepFacePencil: Creating Face Images from Freehand Sketches
本文提出 DeepFacePencil,一种具有双生成器和空间注意力池化(SAP)模块的条件生成对抗网络,用于从手绘草图生成逼真的面部图像。通过自适应调整不同空间位置的逼真度与草图一致性之间的平衡,该模型能稳健地泛化到各种草图风格,包括绘制不佳或变形的笔画,在合成草图和真实手绘草图上的图像质量和鲁棒性均优于现有方法。
In this paper, we explore the task of generating photo-realistic face images from hand-drawn sketches. Existing image-to-image translation methods require a large-scale dataset of paired sketches and images for supervision. They typically utilize synthesized edge maps of face images as training data. However, these synthesized edge maps strictly align with the edges of the corresponding face images, which limit their generalization ability to real hand-drawn sketches with vast stroke diversity. To address this problem, we propose DeepFacePencil, an effective tool that is able to generate photo-realistic face images from hand-drawn sketches, based on a novel dual generator image translation network during training. A novel spatial attention pooling (SAP) is designed to adaptively handle stroke distortions which are spatially varying to support various stroke styles and different levels of details. We conduct extensive experiments and the results demonstrate the superiority of our model over existing methods on both image quality and model generalization to hand-drawn sketches.
研究动机与目标
- 解决从具有多样化笔画风格和缺陷的自由手绘草图生成高质量、逼真面部图像的挑战。
- 克服现有图像到图像转换模型在边缘对齐的合成草图上进行训练时,无法泛化到具有笔画失真的真实手绘草图的局限性。
- 开发一种方法,根据笔画质量在草图的不同区域自适应地平衡图像逼真度与草图一致性。
- 通过在训练数据中引入变形草图并使用可学习的注意力机制处理空间变化的失真,提升模型的泛化能力。
提出的方法
- 采用双生成器训练策略,同时训练两个生成器以提升特征学习能力和鲁棒性。
- 提出一种新颖的空间注意力池化(SAP)模块,通过应用具有不同卷积核大小的多个池化操作,放松对笔画对齐的要求,生成多个松弛的草图表示。
- SAP 模块通过可学习的空间注意力层融合多个松弛草图,根据局部笔画质量和失真程度动态分配重要性。
- 注意力权重按空间位置分别计算,以在绘制较差的区域优先保证逼真度,在绘制较好的区域优先保证草图一致性。
- 模型采用条件生成对抗网络框架进行训练,结合对抗损失、感知损失和身份损失,以确保图像的逼真度和结构一致性。
- 在训练过程中合成具有不同笔画偏移的变形草图,以增强对现实世界绘制差异的鲁棒性。
实验结果
研究问题
- RQ1深度学习模型能否在高保真度和多样化笔画风格泛化能力下,从自由手绘草图生成逼真面部图像?
- RQ2当输入草图包含不一致或失真的笔画时,模型如何平衡图像逼真度与草图一致性?
- RQ3在合成边缘图上进行训练的模型,能在多大程度上泛化到具有不规则笔画模式的真实手绘草图?
- RQ4空间自适应注意力机制的引入是否能提升在低质量或变形草图上的性能?
主要发现
- 所提出的 DeepFacePencil 模型在合成草图和真实手绘草图上的图像质量指标(FID 和 LPIPS)上显著优于基线模型。
- 在专家绘制的草图上,即使基线模型经过变形草图微调,本模型仍能生成更逼真的纹理和完整的面部结构。
- 在使用鼠标绘制的普通用户草图上,本模型保持了高质量的视觉效果且几乎无伪影,而基线模型则产生模糊和失真的结果。
- 该模型能有效泛化到大范围的笔画变形(最大达 d=30),生成无伪影的逼真图像,而基线模型在面部特征上表现出严重失真。
- 空间注意力池化(SAP)模块实现了逼真度与一致性之间的自适应平衡,对可靠草图区域分配更高注意力,对模糊或失真区域施加更多正则化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。