[论文解读] Texture Deformation Based Generative Adversarial Networks for Face Editing
该论文提出TDB-GAN,一种新颖的人脸编辑框架,通过基于DAE的编码器将面部纹理与形变解耦,随后利用纹理到图像的转换技术转移目标属性(如表情、性别、年龄),再通过空间形变将纹理重新映射回原始空间。该方法在CelebA和RaFD数据集上相较于现有基于GAN的人脸编辑模型,实现了更优的视觉质量、更清晰的细节以及更好的身份一致性。
Despite the significant success in image-to-image translation and latent representation based facial attribute editing and expression synthesis, the existing approaches still have limitations in the sharpness of details, distinct image translation and identity preservation. To address these issues, we propose a Texture Deformation Based GAN, namely TDB-GAN, to disentangle texture from original image and transfers domains based on the extracted texture. The approach utilizes the texture to transfer facial attributes and expressions without the consideration of the object pose. This leads to shaper details and more distinct visual effect of the synthesized faces. In addition, it brings the faster convergence during training. The effectiveness of the proposed method is validated through extensive ablation studies. We also evaluate our approach qualitatively and quantitatively on facial attribute and facial expression synthesis. The results on both the CelebA and RaFD datasets suggest that Texture Deformation Based GAN achieves better performance.
研究动机与目标
- 为解决现有基于GAN的人脸编辑方法存在的局限性,如细节锐度不足、属性迁移能力弱以及身份不一致等问题。
- 将面部纹理与形变解耦,并以纹理作为主要媒介进行属性迁移,降低对姿态和形状的依赖。
- 通过基于纹理的图像生成而非直接的图像到图像翻译,提升训练收敛速度与视觉质量。
- 通过输入图像与生成图像之间的专用身份损失,实现编辑过程中的身份保持。
- 验证在人脸属性与表情编辑任务中,纹理到图像翻译相较于图像到图像翻译的优越性。
提出的方法
- 该方法使用可变形自编码器(DAE)将输入图像分解为光照、反照率和形变分量,随后将光照与反照率合并生成清晰且对齐的纹理图像。
- 通过条件生成器(GAN生成器)同时接收提取的纹理和目标域标签(如性别、表情)以合成带有目标属性的新纹理。
- 将合成的纹理通过原始空间形变重新映射,以重建最终的人脸图像,从而保持几何结构。
- 在输入图像与生成图像之间应用身份损失,以在编辑过程中强制保持身份一致性。
- 通过对抗损失、L1重建损失和身份损失联合训练框架,以确保生成结果的真实感与一致性。
- 通过在纹理空间中学习解耦表示,实现多领域人脸编辑(如表情、性别、年龄)
实验结果
研究问题
- RQ1将纹理与形变解耦是否能提升人脸编辑任务中生成人脸的质量与真实感?
- RQ2与直接的图像到图像翻译相比,基于纹理的图像翻译是否能带来更优的属性迁移效果与更清晰的面部细节?
- RQ3在基于纹理的GAN框架中引入身份损失,是否能显著提升身份保持能力?
- RQ4在定性与定量评估中,TDB-GAN相较于SOTA模型(如StarGAN、CycleGAN、IcGAN)的表现如何?
- RQ5解耦的纹理表征是否增强了模型合成不同面部表情的能力?
主要发现
- 在用户研究中,TDB-GAN在微笑转移任务中获得了最高的感知投票率(57.33%),在年龄转移任务中达到62.00%,优于IcGAN、CycleGAN和StarGAN。
- 在RaFD数据集上,TDB-GAN生成图像的面部表情分类准确率达到97.28%,显著高于IcGAN(91.61%)、CycleGAN(88.44%)和StarGAN(92.06%)。
- 该方法生成了更清晰的面部细节,尤其是在眼部区域,且表情更具辨识度(如愤怒、恐惧等),优于StarGAN及其他基线模型。
- 用户研究表明,TDB-GAN生成的图像在真实感、属性质量与身份保持方面均优于竞争模型。
- 消融实验表明,基于纹理的翻译与身份损失对性能均至关重要,其中身份损失显著提升了身份一致性。
- 由于纹理空间中解耦表征的存在,TDB-GAN展现出更快的训练收敛速度与更强的多领域泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。