[论文解读] FaR-GAN for One-Shot Face Reenactment
FaR-GAN 提出了一种单样本人脸重演模型,仅使用一张源身份图像和面部关键点掩码,即可生成逼真的目标表情人脸图像。该模型采用基于生成对抗网络(GAN)的架构,将卷积层的可学习特征作为输入,结合SPADE模块、自注意力机制和噪声注入,实现在VoxCeleb1数据集上的最先进FID(27.1)和SSIM(0.68)指标,显著优于先前方法,在图像质量和身份保留方面表现更优。
Animating a static face image with target facial expressions and movements is important in the area of image editing and movie production. This face reenactment process is challenging due to the complex geometry and movement of human faces. Previous work usually requires a large set of images from the same person to model the appearance. In this paper, we present a one-shot face reenactment model, FaR-GAN, that takes only one face image of any given source identity and a target expression as input, and then produces a face image of the same source identity but with the target expression. The proposed method makes no assumptions about the source identity, facial expression, head pose, or even image background. We evaluate our method on the VoxCeleb1 dataset and show that our method is able to generate a higher quality face image than the compared methods.
研究动机与目标
- 为解决仅有一张源身份图像可供表情迁移的单样本人脸重演挑战。
- 在不假设身份、姿态或背景的前提下,生成高保真度的人脸图像,实现高身份保留和表情准确性。
- 相比现有的基于GAN的方法和三维建模方法,提升图像质量并减少伪影。
- 仅使用面部关键点作为控制信号,无需身份特定的训练数据,实现灵活的重演。
- 探究自注意力机制和噪声注入等架构组件对重演保真度的影响。
提出的方法
- 模型采用基于GAN的框架,其生成器结合内容编码器、风格编码器和Transformer网络,以合成目标表情。
- 使用关键点掩码作为条件输入,基于轮廓的表示方式相比二值掩码性能更优,因其具备更优的部件语义分离能力。
- SPADE模块基于中间卷积层的可学习特征进行条件化,而非多尺度关键点掩码,从而实现更精确的空间控制。
- 在生成器中集成自注意力模块,以增强长距离特征建模能力,提升空间一致性。
- 在解码过程中引入噪声注入,以增强高频细节,尤其在头发和纹理区域表现更佳。
- 判别器通过端到端训练,用于区分真实图像与生成图像,从而引导生成器向逼真方向优化。
实验结果
研究问题
- RQ1基于GAN的模型能否仅使用单张源图像和面部关键点,实现高保真度的单样本人脸重演?
- RQ2与多尺度掩码相比,使用可学习的卷积特征是否能提升重演质量?
- RQ3自注意力机制和噪声注入在多大程度上能提升图像质量并减少伪影?
- RQ4该模型在无先验假设的前提下,对多样化身份、表情和姿态的泛化性能如何?
- RQ5不同关键点表示格式(轮廓 vs. 二值掩码)对最终重演质量有何影响?
主要发现
- FaR-GAN 在VoxCeleb1数据集上实现了27.1的Fréchet Inception Distance(FID)和0.68的结构相似性指数(SSIM),优于基线方法。
- 基于轮廓的关键点表示相比二值掩码(FID 52.1)显著提升性能(FID 27.1),表明部件级语义信息有助于特征解耦。
- 消融实验表明,自注意力和噪声注入均能降低FID:从无任何组件时的63.9降至两者均启用时的27.1,显著提升视觉质量并减少伪影。
- 视觉结果表明,噪声注入增强了高频细节,尤其在头发和面部纹理区域,差异图像分析进一步验证了该现象。
- 即使目标图像在姿态和表情上存在显著变化,模型仍能有效保留身份、背景和衣物特征。
- 尽管性能优异,当源与目标身份在性别或面部尺寸上差异显著时,仍存在身份偏差问题,表明仍需进一步优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。