Skip to main content
QUICK REVIEW

[论文解读] Cascade EF-GAN: Progressive Facial Expression Editing with Local Focuses

Rongliang Wu, Gongjie Zhang|arXiv (Cornell University)|Mar 12, 2020
Generative Adversarial Networks and Image Synthesis参考文献 50被引用 10
一句话总结

本文提出Cascade EF-GAN,一种渐进式面部表情编辑框架,通过在眼睛、鼻子和嘴巴区域引入局部关注机制,以保留身份细节并减少伪影。通过将大表情差异的转换分解为多个小步骤,利用EF-GAN模块的级联结构,该方法在生成结果的真实感和无伪影方面优于以往基于GAN的方法。

ABSTRACT

Recent advances in Generative Adversarial Nets (GANs) have shown remarkable improvements for facial expression editing. However, current methods are still prone to generate artifacts and blurs around expression-intensive regions, and often introduce undesired overlapping artifacts while handling large-gap expression transformations such as transformation from furious to laughing. To address these limitations, we propose Cascade Expression Focal GAN (Cascade EF-GAN), a novel network that performs progressive facial expression editing with local expression focuses. The introduction of the local focus enables the Cascade EF-GAN to better preserve identity-related features and details around eyes, noses and mouths, which further helps reduce artifacts and blurs within the generated facial images. In addition, an innovative cascade transformation strategy is designed by dividing a large facial expression transformation into multiple small ones in cascade, which helps suppress overlapping artifacts and produce more realistic editing while dealing with large-gap expression transformations. Extensive experiments over two publicly available facial expression datasets show that our proposed Cascade EF-GAN achieves superior performance for facial expression editing.

研究动机与目标

  • 解决面部表情编辑中的伪影和模糊问题,尤其是在眼睛、鼻子和嘴巴等表情丰富区域。
  • 克服单步基于GAN的方法在大表情差异转换(如从愤怒到大笑)中常见的重叠伪影问题。
  • 通过显式建模与身份相关的特征,利用局部注意力机制提升身份保持能力。
  • 设计一种渐进式编辑策略,将复杂的表情变化分解为多个小而可控的转换步骤。
  • 通过结合局部关注机制与级联结构,在公开数据集上实现面部表情编辑的最先进性能。

提出的方法

  • 在每个EF-GAN模块中引入眼睛、鼻子和嘴巴三个局部关注机制,以捕捉与身份相关的特征,并指导高保真度编辑。
  • 在每个EF-GAN中设计表达变换器(Expression Transformer)和精炼器(Refiner),分别在全局和局部区域生成并优化初始表情编辑结果。
  • 通过多个EF-GAN模块的级联结构实现渐进式表情编辑,将大差异转换分解为一系列小步长的连续变换。
  • 在精炼器与局部关注模块之间引入中间特征融合,以增强细节保留并减少模糊现象。
  • 采用预训练的Inception网络进行FID评估,并使用PSNR比较生成结果与真实标签之间的差异。
  • 在RaFD和CFEED数据集上预训练后,通过在AffectNet数据集上微调,使模型适应野外图像(wild images)的复杂场景。

实验结果

研究问题

  • RQ1在身份关键区域(如眼睛、鼻子、嘴巴)引入局部注意力是否能有效减少面部表情编辑中的伪影与模糊?
  • RQ2通过级联结构将大表情差异转换分解为多个小步长,是否能有效减少重叠伪影?
  • RQ3局部关注与渐进式编辑的结合如何提升身份保持能力与视觉真实感?
  • RQ4所提方法是否能在具有复杂背景和非受控光照条件的野外图像上实现良好泛化?
  • RQ5与单步GAN相比,级联设计在复杂表情编辑任务中的性能提升程度如何?

主要发现

  • 在RaFD数据集上,Cascade EF-GAN相比最先进方法提升1.01 PSNR与3.19 FID;在CFEED数据集上分别提升0.91 PSNR与1.92 FID。
  • 消融实验表明,局部关注与级联设计均不可或缺,完整模型生成的图像最清晰、表情对齐最佳,且伪影最少。
  • 视觉结果表明,基线模型在眼睛和嘴角区域易丢失细节,而引入局部关注的EF-GAN显著减少了模糊与失真。
  • 级联设计通过将复杂度分布到多个步骤,有效抑制了大差异转换中的重叠伪影。
  • 通过插值动作单元并分步应用模型,实现了连续的表情编辑,生成了自然流畅的过渡效果。
  • 模型在野外图像上表现出良好泛化能力,有效保持身份特征与背景完整性,同时准确迁移目标表情。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。