[论文解读] Unconstrained Facial Expression Transfer using Style-based Generator
该论文提出了一种基于风格的 GAN 方法,用于无约束面部表情迁移,利用预训练 StyleGAN 的分层风格向量来解耦面部属性。通过优化来自两张输入图像的风格向量的线性组合,该方法合成出高质量、逼真的面部图像,其外观来自一张图像而表情来自另一张,无需几何标注或针对新身份的微调,实现了最先进性能。
Facial expression transfer and reenactment has been an important research problem given its applications in face editing, image manipulation, and fabricated videos generation. We present a novel method for image-based facial expression transfer, leveraging the recent style-based GAN shown to be very effective for creating realistic looking images. Given two face images, our method can create plausible results that combine the appearance of one image and the expression of the other. To achieve this, we first propose an optimization procedure based on StyleGAN to infer hierarchical style vector from an image that disentangle different attributes of the face. We further introduce a linear combination scheme that fuses the style vectors of the two given images and generate a new face that combines the expression and appearance of the inputs. Our method can create high-quality synthesis with accurate facial reenactment. Unlike many existing methods, we do not rely on geometry annotations, and can be applied to unconstrained facial images of any identities without the need for retraining, making it feasible to generate large-scale expression-transferred results.
研究动机与目标
- 解决在无配对训练数据或几何标注的情况下,从无约束面部图像中实现逼真面部表情迁移的挑战。
- 实现在无需微调的情况下跨任意身份的表情迁移,确保可扩展性和泛化能力。
- 开发一种完全自动化的端到端系统,通过潜在空间优化融合两张输入图像的外观与表情。
- 克服现有基于几何或学习的方法的局限性,后者依赖于 3D 模型、关键点追踪或身份特定训练。
- 提供一种可扩展的解决方案,用于生成大规模表情迁移图像,适用于训练鲁棒的 DeepFake 检测模型。
提出的方法
- 使用预训练的 StyleGAN 通过优化从面部图像中推断分层风格向量,实现多潜在层上表情、发色、姿态等属性的解耦。
- 应用整数线性规划(ILP)框架,优化来自两张输入图像的风格向量的线性组合,以保留目标身份的外观和源图像的表情。
- 利用不同层的 VGG-16 特征进行感知损失,以指导风格向量优化,其中第 9 层获得最佳重建质量。
- 在不同层上进行风格向量拼接,以分析属性解耦效果,发现第 4 层对表情变化最为敏感。
- 通过将优化后的风格向量输入 StyleGAN 生成器,生成逼真的人脸重演图像,无需显式形状或纹理建模。
- 确保端到端推理完全自动化,适用于任意面部图像,包括极端姿态或遮挡情况,且无需模型微调。
实验结果
研究问题
- RQ1来自预训练 StyleGAN 的分层风格向量能否有效解耦表情、外观和姿态等面部属性?
- RQ2如何最优地组合来自两张不同面部图像的风格向量,以实现表情迁移同时保留身份外观?
- RQ3潜在空间优化方法在无几何标注或身份特定训练的情况下,能在多大程度上实现高保真度的面部重演?
- RQ4不同感知损失层对风格向量推理过程中重建图像质量与一致性的影晌如何?
- RQ5该方法在包括遮挡或复杂光照条件在内的无约束真实世界面部图像上,泛化能力如何?
主要发现
- 与基于几何和基于学习的基线方法相比,该方法在面部表情迁移方面实现了更优的视觉质量,结果在感知上更逼真且一致。
- 使用 VGG-16 第 9 层作为感知损失层可获得最高重建质量,显著减少伪影并保留面部细节。
- 风格向量的第 4 层对表情变化最敏感,将该层从源图像切换到目标图像可实现准确的表情迁移。
- 该方法成功实现了在多样化身份和无约束图像(包括网络抓取的人脸和极端姿态)之间的表情迁移,且无需微调。
- 失败案例主要出现在严重遮挡或强阴影情况下,此时模型难以重建完整的面部结构或自然光照。
- 该系统可大规模生成表情迁移图像,证明了其在训练鲁棒 DeepFake 检测模型等应用中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。