[论文解读] One-Shot Face Reenactment on Megapixels
本文提出MegaFR,一种一次输入、高分辨率的人脸重演方法,通过利用基于3DMM的渲染图像作为StyleGAN的输入,实现对身份、表情和头部姿态的显式控制。通过设计无需视频数据集的视频无关损失函数并应用迭代优化,MegaFR在无需高质量视频数据集的情况下,实现了超逼真的百万像素级结果,在解耦性和视觉保真度方面优于先前方法。
The goal of face reenactment is to transfer a target expression and head pose to a source face while preserving the source identity. With the popularity of face-related applications, there has been much research on this topic. However, the results of existing methods are still limited to low-resolution and lack photorealism. In this work, we present a one-shot and high-resolution face reenactment method called MegaFR. To be precise, we leverage StyleGAN by using 3DMM-based rendering images and overcome the lack of high-quality video datasets by designing a loss function that works without high-quality videos. Also, we apply iterative refinement to deal with extreme poses and/or expressions. Since the proposed method controls source images through 3DMM parameters, we can explicitly manipulate source images. We apply MegaFR to various applications such as face frontalization, eye in-painting, and talking head generation. Experimental results show that our method successfully disentangles identity from expression and head pose, and outperforms conventional methods.
研究动机与目标
- 解决一次输入人脸重演中缺乏高质量、高分辨率视频数据集的问题。
- 克服潜在空间中身份、表情与姿态之间的纠缠,实现可控的人脸操作。
- 仅使用单张源图像实现高分辨率(百万像素)的人脸重演。
- 开发一种在极端姿态与表情下仍能保持身份一致性的方法。
- 通过人脸正向化、眼部修复与说话头生成等应用,展示方法的可控性。
提出的方法
- 将基于3DMM的渲染图像(由3DMM参数生成)作为输入送入StyleGAN编码器,相比原始3DMM参数,提供更具可解释性且更适合CNN处理的特征。
- 采用新型损失函数,通过感知与身份保持约束,在无需高质量视频数据集的情况下实现训练。
- 通过类似ReStyle的优化策略实施迭代优化,提升在极端姿态与表情下的重建质量。
- 利用GAN反演技术(pSp、e4e或PTI)将真实源图像映射至StyleGAN潜在空间,同时保留身份细节。
- 通过3DMM参数显式控制源图像,实现身份、表情与姿态的解耦操作。
- 将StyleGAN与3DMM先验相结合,实现可控、高保真的人脸生成与编辑。
实验结果
研究问题
- RQ1能否仅使用一张源图像,在不依赖大规模视频数据集的情况下实现百万像素级的人脸重演?
- RQ2基于3DMM的渲染图像是否能提升StyleGAN中潜在空间操作的可解释性与性能?
- RQ3无视频损失函数在高分辨率人脸重演中,对身份保持与逼真度的维持效果如何?
- RQ4迭代优化是否能有效处理一次输入重演中的极端面部表情与头部姿态?
- RQ5该方法在其他人脸操作任务(如人脸正向化与眼部修复)中的泛化能力如何?
主要发现
- MegaFR在人脸正向化任务中达到最先进性能,使用pSp时Fréchet Inception Distance(FID)为24.3,使用e4e时为27.2,显著优于R&R(88.0)与pSp(62.8)。
- 使用pSp时感知相似性(LPIPS)为0.23,使用e4e时为0.27,表明正向化结果具有高感知质量。
- 通过直接操控3DMM参数,无需参考图像即可成功实现眼部修复,实现对眼睑张开强度的控制。
- 在高分辨率(1024×1024)下生成了说话头序列,准确传递了唇部运动与面部表情,包括眨眼动作。
- PTI优化有效减少了身份漂移,并在域外图像中保留了细节,如定性结果所示。
- MegaFR成功实现身份与表情、姿态的解耦,通过3DMM参数实现对人脸属性的显式控制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。