Skip to main content
QUICK REVIEW

[论文解读] A Realistic Face-to-Face Conversation System based on Deep Neural Networks

Zezhou Chen, Zhaoxiang Liu|arXiv (Cornell University)|Aug 21, 2019
Face recognition and analysis参考文献 42被引用 5
一句话总结

本文提出了一种基于深度学习的面对面对话系统,通过使用两个序列到序列模型(分别用于倾听和说话)以及基于生成对抗网络(GAN)的像素级角色形象生成器,实现角色形象的逼真、自然面部反应。该系统通过从ESPN视频数据中学习面部动作单元和头部姿态,实现了最先进的逼真度,在面部真实感和时间一致性方面优于基于3D模型的基线方法。

ABSTRACT

To improve the experiences of face-to-face conversation with avatar, this paper presents a novel conversation system. It is composed of two sequence-to-sequence models respectively for listening and speaking and a Generative Adversarial Network (GAN) based realistic avatar synthesizer. The models exploit the facial action and head pose to learn natural human reactions. Based on the models' output, the synthesizer uses the Pixel2Pixel model to generate realistic facial images. To show the improvement of our system, we use a 3D model based avatar driving scheme as a reference. We train and evaluate our neural networks with the data from ESPN shows. Experimental results show that our conversation system can generate natural facial reactions and realistic facial images.

研究动机与目标

  • 为解决虚拟助手在面对面对话中缺乏自然非语言反馈的问题。
  • 建模对话中类似人类的说话与倾听角色之间的自然交替行为。
  • 使用深度神经网络生成逼真的面部表情和头部动作,而无需依赖3D建模或动作捕捉数据。
  • 开发一个端到端系统,从语音和非语言线索生成逼真的角色形象图像。

提出的方法

  • 系统使用两个独立的序列到序列(Seq2Seq)模型:一个用于倾听(根据说话者线索预测倾听者的面部动作和头部姿态),另一个用于说话(根据言语回应预测说话者的面部动作和头部姿态)。
  • 从输入视频帧中提取面部动作单元和头部姿态作为非语言特征,作为Seq2Seq模型的输入和输出。
  • 使用基于Pix2Pix的生成对抗网络(GAN)从预测的面部动作单元和头部姿态生成高保真、逼真的面部图像。
  • 系统在ESPN节目视频数据上进行训练和评估,通过度量学习提升倾听和说话阶段的特征表示能力。
  • 角色形象生成器从生成输出中重建面部特征,并使用动作单元和头部姿态的L1损失与真实值进行比较。

实验结果

研究问题

  • RQ1深度学习系统能否在面对面对话中生成自然、逼真的角色形象面部反应?
  • RQ2序列到序列模型在从语音和倾听线索中预测非语言行为(面部动作和头部姿态)方面是否有效?
  • RQ3基于GAN的图像生成方法能否比传统的3D模型驱动方法生成更逼真的角色形象图像?
  • RQ4所提出的系统在面部真实感和时间一致性方面是否优于基线方法?

主要发现

  • 在倾听阶段,所提系统相比基线模型表现出更低的均方误差(MSE: 0.0540)和更高的余弦相似度(0.992),而基线模型的MSE为0.0565,余弦相似度为0.983。
  • 在说话阶段,系统显著优于基线模型,MSE为0.141(基线为0.195),余弦相似度为0.980(基线为0.9635)。
  • 角色形象生成器在倾听阶段的重建误差较低:动作单元为0.046,头部姿态为0.038;在说话阶段分别为0.105和0.073。
  • 视觉对比显示,合成的角色形象图像比基于3D模型的角色形象更逼真,且更接近真实值。
  • 系统在说话阶段表现更优,该阶段面部变化更复杂,表明所提出的度量学习在捕捉复杂非语言模式方面具有优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。