Skip to main content
QUICK REVIEW

[论文解读] Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions

Zipeng Ye, Zhiyao Sun|arXiv (Cornell University)|Apr 13, 2022
Advanced Vision and Imaging被引用 9
一句话总结

本文提出动态神经纹理(DNT),一种实时生成高质量说话人脸视频的方法,可连续控制面部表情。通过使用可学习的、基于表情的神经纹理图与基于3DMM的几何模型,将表情与唇部运动解耦,该方法实现了精确、用户可控的表情强度,以及卓越的唇部同步效果,在定量指标和用户研究中均优于当前最先进基线方法。

ABSTRACT

Recently, talking-face video generation has received considerable attention. So far most methods generate results with neutral expressions or expressions that are implicitly determined by neural networks in an uncontrollable way. In this paper, we propose a method to generate talking-face videos with continuously controllable expressions in real-time. Our method is based on an important observation: In contrast to facial geometry of moderate resolution, most expression information lies in textures. Then we make use of neural textures to generate high-quality talking face videos and design a novel neural network that can generate neural textures for image frames (which we called dynamic neural textures) based on the input expression and continuous intensity expression coding (CIEC). Our method uses 3DMM as a 3D model to sample the dynamic neural texture. The 3DMM does not cover the teeth area, so we propose a teeth submodule to complete the details in teeth. Results and an ablation study show the effectiveness of our method in generating high-quality talking-face videos with continuously controllable expressions. We also set up four baseline methods by combining existing representative methods and compare them with our method. Experimental results including a user study show that our method has the best performance.

研究动机与目标

  • 为了解决现有说话人脸视频方法生成中性或不可控表情的局限性。
  • 实现实时、细粒度的生成说话人脸视频中面部表情强度与类型的控制。
  • 将唇部运动与面部表情解耦,以提升时间一致性与控制能力。
  • 通过专用子模块增强嘴部区域(尤其是牙齿)的视觉质量。
  • 在表情控制、唇部同步与视觉质量方面,相比现有最先进方法实现更优性能。

提出的方法

  • 该方法以3D可变形模型(3DMM)作为几何基础,用于采样动态神经纹理,即高维、可学习的特征图,其受表情输入条件控制。
  • 提出一种新型解耦网络,将表情表征与唇部运动及头部姿态分离,实现表情强度与类型的独立控制。
  • 通过受连续强度表情编码(CIEC)条件控制的神经网络生成动态神经纹理(DNT),实现实时、连续的表情控制。
  • 引入牙齿子模块,用于重建3DMM未覆盖的牙齿区域缺失细节,提升嘴部区域的逼真度。
  • 系统采用神经渲染技术,从动态神经纹理与3D几何结构合成逼真图像帧,确保高视觉保真度。

实验结果

研究问题

  • RQ1是否能够有效将面部表情信息编码到高分辨率神经纹理中,而非3D几何结构中,从而在说话人脸视频生成中实现更优的表情控制?
  • RQ2如何在保持唇部同步与时间连贯性的前提下,实现实时、连续的表情强度与类型控制?
  • RQ3解耦网络是否能有效分离3D人脸模型中的表情与唇部运动及头部姿态,以实现独立控制?
  • RQ4专用牙齿子模块在多大程度上提升了生成说话人脸视频中嘴部区域的视觉质量?
  • RQ5与现有最先进方法相比,该方法在表情控制、唇部同步与视觉质量方面的表现如何?

主要发现

  • 所提方法在所有对比方法中取得最高的PSNR(27.41)与SSIM(0.892),表明视频质量更优。
  • 该方法在测试集上获得CSS得分为6.71,与真实值平均分一致,表明唇部同步完美。
  • 消融实验表明,若移除动态神经纹理或解耦网络,性能显著下降,证实二者不可或缺。
  • 牙齿子模块通过定性结果与用户研究反馈,证实可提升嘴部区域的视觉质量。
  • 用户研究与定量指标共同表明,所提方法在表情可控性与真实感方面全面优于所有基线方法,包括Wav2Lip、StarGAN、ExprGAN与EVP。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。