[论文解读] One-Shot Identity-Preserving Portrait Reenactment
本文提出了一种单次、身份保持的肖像重演方法,仅需一张目标图像和驱动主体视频的2D面部关键点。该方法引入了关键点解耦网络(LD-Net),将身份与姿态/表情分离,并采用基于特征字典的生成对抗网络(FD-GAN)合成逼真的肖像图像,在身份保持和对未见主体的泛化能力方面优于当前最先进方法。
We present a deep learning-based framework for portrait reenactment from a single picture of a target (one-shot) and a video of a driving subject. Existing facial reenactment methods suffer from identity mismatch and produce inconsistent identities when a target and a driving subject are different (cross-subject), especially in one-shot settings. In this work, we aim to address identity preservation in cross-subject portrait reenactment from a single picture. We introduce a novel technique that can disentangle identity from expressions and poses, allowing identity preserving portrait reenactment even when the driver's identity is very different from that of the target. This is achieved by a novel landmark disentanglement network (LD-Net), which predicts personalized facial landmarks that combine the identity of the target with expressions and poses from a different subject. To handle portrait reenactment from unseen subjects, we also introduce a feature dictionary-based generative adversarial network (FD-GAN), which locally translates 2D landmarks into a personalized portrait, enabling one-shot portrait reenactment under large pose and expression variations. We validate the effectiveness of our identity disentangling capabilities via an extensive ablation study, and our method produces consistent identities for cross-subject portrait reenactment. Our comprehensive experiments show that our method significantly outperforms the state-of-the-art single-image facial reenactment methods. We will release our code and models for academic use.
研究动机与目标
- 解决仅有一张目标图像时跨主体肖像重演中的身份不匹配问题。
- 在将不同驱动主体的表情和姿态转移至目标主体的同时保持其身份特征。
- 实现无需针对特定主体微调或训练的主体无关重演。
- 在大姿态和表情变化下实现高保真、逼真的肖像图像合成。
- 克服基于2D关键点方法在身份和面部细节保持方面的局限性。
提出的方法
- 提出一种关键点解耦网络(LD-Net),通过结合目标身份与驱动主体的表情和姿态,预测个性化面部关键点,从而将身份与姿态/表情解耦。
- 采用基于特征字典的生成对抗网络(FD-GAN),将2D关键点坐标局部转换为个性化肖像图像,实现身份保持的图像合成。
- 利用解耦的关键点表征,确保即使目标主体与驱动主体外观差异极大,也能保持身份一致性。
- 借助预训练的特征字典,将关键点特征映射为高分辨率、逼真的人脸图像,无需针对每个主体进行适应。
- 结合2D关键点监督与对抗训练,提升图像保真度和结构一致性。
- 设计两阶段框架:首先将身份与运动线索解耦,然后基于解耦的关键点生成身份一致的图像。
实验结果
研究问题
- RQ12D面部关键点能否被有效解耦为与身份无关的运动分量与与身份相关的特征,以实现跨主体重演?
- RQ2单张参考图像是否能实现无需主体特定训练的高保真、身份保持的肖像重演?
- RQ3基于关键点的方法在大姿态和表情变化下对未见主体的泛化能力如何?
- RQ4与标准生成对抗网络相比,所提出的基于特征字典的生成对抗网络是否在单次设置下提升了身份保持能力和图像质量?
- RQ5关键点解耦对肖像重演中时间一致性与视觉保真度的影响如何?
主要发现
- 在CrossTest数据集上,该方法实现了0.7762的最高身份相似度(ISIM)分数,优于X2Face(0.6347)和First-order-model(0.7699)。
- 该方法的PSIM得分为0.840,表明与目标身份具有极强的感知相似性,超过基线方法First-order-model(0.822)。
- 该方法将边缘失真(ED)降低至0.243,相比X2Face(0.448)和First-order-model(0.274)显示出更优的结构保真度。
- FID得分为67.68,表明其生成图像分布与真实图像更接近,尽管FID值较高,但因身份保持能力更强而更具优势。
- 定性结果表明,即使驱动主体与目标主体外观差异极大,该方法在各种姿态和表情下仍能保持身份的一致性。
- 消融实验证实,关键点解耦对身份保持至关重要,尤其在跨主体场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。