Skip to main content
QUICK REVIEW

[论文解读] Video synthesis of human upper body with realistic face

Zhaoxiang Liu, Huan Hu|arXiv (Cornell University)|Aug 19, 2019
Generative Adversarial Networks and Image Synthesis参考文献 20被引用 7
一句话总结

本文提出了一种基于生成对抗网络(GAN)的方法,用于合成目标人物的逼真上半身视频,同时保留源视频中的运动、面部表情和姿态。通过利用面部动作单元(FAUP)和上半身关键点(UBKP)作为中间表征,该方法通过身份不变的FAUP将源表情映射到目标身份,再利用改进的pix2pixHD框架结合时空平滑和感知损失,生成时序一致且高保真的视频,实现了逼真的面部重演和运动迁移。

ABSTRACT

This paper presents a generative adversarial learning-based human upper body video synthesis approach to generate an upper body video of target person that is consistent with the body motion, face expression, and pose of the person in source video. We use upper body keypoints, facial action units and poses as intermediate representations between source video and target video. Instead of directly transferring the source video to the target video, we firstly map the source person's facial action units and poses into the target person's facial landmarks, then combine the normalized upper body keypoints and generated facial landmarks with spatio-temporal smoothing to generate the corresponding target video's image. Experimental results demonstrated the effectiveness of our method.

研究动机与目标

  • 解决生成目标人物逼真上半身视频的挑战,同时保留源视频中的运动、面部表情和姿态。
  • 克服先前方法在直接图像到图像翻译中因丢失运动细节或无法生成逼真面部纹理而带来的局限性。
  • 开发一个统一的流程,整合身体运动迁移与高保真面部重演,无需依赖3D动作捕捉。
  • 通过使用面部动作单元(FAUP)作为身份不变的中间表征,实现身体运动与面部表情的无缝融合。
  • 通过时空平滑和感知损失函数,确保生成视频序列在时序上的一致性和视觉质量。

提出的方法

  • 使用预训练的姿态检测器从源视频中估计上半身关键点(UBKP)并提取面部动作单元(FAUP),作为中间表征。
  • 通过学习的映射将源FAUP转换为目标面部关键点,利用FAUP的身份不变性避免复杂的归一化操作。
  • 通过拼接归一化的UBKP和生成的面部关键点(UBKP-FL)构建条件输入,用于视频合成。
  • 使用对抗损失 $ L_{GAN} $、$ L_1 $ 重建损失和感知损失 $ L_{VGG} $ 训练改进的pix2pixHD网络,以生成高保真图像。
  • 引入时间平滑损失 $ L_{tS} $,使帧生成同时依赖于过去的源帧和先前生成的帧,以确保时序一致性。
  • 应用特征匹配损失 $ L_{FM} $,并将多种损失整合到统一目标函数中:$ ext{min}_G ext{max}_D ig( ext{sum of } L_{tS}, L_{FM}, L_{VGG} ig) $。

实验结果

研究问题

  • RQ1面部动作单元(FAUP)能否作为有效的、身份不变的中间表征,用于将源人物的面部表情准确迁移至目标人物?
  • RQ2如何在保持逼真感和时序一致性的前提下,联合实现身体运动与面部表情的迁移?
  • RQ3基于UBKP和FAUP的GAN框架是否能优于简单拼接独立的面部和身体重演模型?
  • RQ4所提出的时序平滑损失在多大程度上提升了生成视频序列的视觉质量和一致性?
  • RQ5感知损失、对抗损失与 $ L_1 $ 损失的组合如何影响合成上半身视频的逼真度与保真度?

主要发现

  • 该方法成功生成了与源视频在运动、表情和姿态上保持一致的目标人物逼真上半身视频。
  • 使用FAUP作为中间表征,无需在身份之间进行复杂归一化,即可实现准确的面部表情迁移。
  • 结合过去帧的时间平滑显著提升了视觉质量,减少了生成视频序列中的闪烁或不一致现象。
  • 与基线GAN相比,$ L_{VGG} $、$ L_{FM} $ 和 $ L_{tS} $ 损失的组合带来了更逼真、更符合人类感知的结果。
  • 该框架通过实现运动与面部细节的无缝整合,优于简单融合独立面部和身体重演模型的基线方法。
  • 尽管性能表现优异,该方法仍计算开销较大,提示未来工作需探索轻量化架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。