Skip to main content
QUICK REVIEW

[论文解读] A Neural Virtual Anchor Synthesizer based on Seq2Seq and GAN Models

Zipeng Wang, Zhaoxiang Liu|arXiv (Cornell University)|Aug 20, 2019
Face recognition and analysis参考文献 40被引用 4
一句话总结

该论文提出了一种基于Seq2Seq与GAN的新型框架,通过使用词嵌入、面部动作单元(AU)和姿态序列(PS)作为中间表示,实现从文本生成逼真且时序一致的虚拟主播说话人脸视频。该方法实现了与语音同步的逼真嘴部动作,其有效性通过在ESPN新闻视频上的定性结果得到验证。

ABSTRACT

This paper presents a novel framework to generate realistic face video of an anchor, who is reading certain news. This task is also known as Virtual Anchor. Given some paragraphs of words, we first utilize a pretrained Word2Vec model to embed each word into a vector; then we utilize a Seq2Seq-based model to translate these word embeddings into action units and head poses of the target anchor; these action units and head poses will be concatenated with facial landmarks as well as the former $n$ synthesized frames, and the concatenation serves as input of a Pix2PixHD-based model to synthesize realistic facial images for the virtual anchor. The experimental results demonstrate our framework is feasible for the synthesis of virtual anchor.

研究动机与目标

  • 生成逼真且时序一致的虚拟主播人脸视频,使其能够朗读给定文本,并确保面部动作与语音内容匹配。
  • 通过使用中间表示(AU+PS与FLM)避免复杂的3D人脸建模,以连接文本与图像生成。
  • 通过结合基于GAN的图像生成与序列建模,提升生成结果的保真度,确保时序一致性。
  • 展示使用轻量化、非3D方法实现端到端文本到视频合成在虚拟主播中的可行性。

提出的方法

  • 使用Word2Vec将输入文本嵌入为200维向量,以实现序列表示。
  • 采用LSTM的Seq2Seq模型将词嵌入转换为20维的AU+PS序列(17维动作单元 + 3维头部姿态),以表示面部运动。
  • 将AU+PS序列与平均面部关键点(FLM)以及先前n帧合成的图像拼接,形成多模态输入。
  • 使用改进的Pix2PixHD生成器,基于该拼接输入生成逼真的人脸图像,损失函数包括对抗性损失、特征匹配损失和感知损失。
  • 判别器同时评估生成图像序列的真实感与时序一致性。
  • 联合损失函数包含对抗性损失、特征匹配损失以及基于VGG的感知损失,以提升图像质量与一致性。

实验结果

研究问题

  • RQ1Seq2Seq模型能否有效将文本嵌入映射为面部动作单元与姿态序列,以实现逼真虚拟主播动画?
  • RQ2将AU+PS与平均面部关键点及先前生成帧结合,是否能提升生成人脸视频的逼真度与时序一致性?
  • RQ3基于GAN的图像生成框架能否生成与输入文本语言内容及面部动态相匹配的逼真人脸图像?
  • RQ4与现有3D建模方法或直接图像到图像转换方法相比,该方法在视觉保真度与同步性方面表现如何?

主要发现

  • 该框架成功生成了逼真的人脸视频,其中嘴部动作与输入文本实现同步,定性结果已得到验证。
  • 使用AU+PS作为中间表示,可在无需3D人脸模型的情况下实现准确的面部运动预测。
  • 引入平均面部关键点与先前帧可提升训练稳定性,并增强生成序列的空间-时序一致性。
  • 对抗性损失、特征匹配损失与感知损失的结合,实现了高保真度的图像生成,具有逼真的纹理与表情。
  • 该方法在帧间保持了稳定的面部动态,运动过渡中极少出现伪影或不一致现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。