Skip to main content
QUICK REVIEW

[论文解读] Live Speech Portraits: Real-Time Photorealistic Talking-Head Animation

Yuanxun Lu, Jinxiang Chai|arXiv (Cornell University)|Sep 22, 2021
Face recognition and analysis参考文献 72被引用 11
一句话总结

LIVE Speech Portraits(LSP)是首个实时、由音频驱动的个性化、逼真说话头像动画系统,帧率超过30 fps。它通过流形投影技术,利用深度音频特征提取将未经控制的音频适配到目标说话人的语音空间;采用自回归概率模型生成个性化头部姿态;并通过带有条件特征图的图像到图像转换网络,实现实时高保真度面部细节与动作的合成。

ABSTRACT

To the best of our knowledge, we first present a live system that generates personalized photorealistic talking-head animation only driven by audio signals at over 30 fps. Our system contains three stages. The first stage is a deep neural network that extracts deep audio features along with a manifold projection to project the features to the target person's speech space. In the second stage, we learn facial dynamics and motions from the projected audio features. The predicted motions include head poses and upper body motions, where the former is generated by an autoregressive probabilistic model which models the head pose distribution of the target person. Upper body motions are deduced from head poses. In the final stage, we generate conditional feature maps from previous predictions and send them with a candidate image set to an image-to-image translation network to synthesize photorealistic renderings. Our method generalizes well to wild audio and successfully synthesizes high-fidelity personalized facial details, e.g., wrinkles, teeth. Our method also allows explicit control of head poses. Extensive qualitative and quantitative evaluations, along with user studies, demonstrate the superiority of our method over state-of-the-art techniques.

研究动机与目标

  • 开发一种仅依赖音频驱动的实时、个性化且逼真的说话头像动画系统。
  • 解决将未经控制的、非受控音频映射到富有表现力、个性化说话人面部动态与动作的挑战。
  • 仅从音频实现可控、时间一致的头部与上半身动作生成。
  • 合成高保真、逼真的面部渲染效果,保留个体特征如皱纹与牙齿。
  • 在不牺牲视觉质量或个性化程度的前提下,实现30 fps以上的实时性能。

提出的方法

  • 自监督音频特征提取器从原始音频中生成与说话人无关的表征。
  • 流形投影层利用目标说话人的特定参考特征,将未经控制的音频特征映射到目标说话人的语音空间。
  • 自回归概率模型基于当前音频与历史姿态预测头部姿态分布,实现个性化且连贯的动作生成。
  • 通过预测的头部姿态推断上半身动作,以保持时间一致性。
  • 从面部关键点与姿态预测生成条件特征图,并输入图像到图像转换网络。
  • 图像转换网络利用候选图像集与预测的动作特征,合成逼真帧,实现高保真渲染。

实验结果

研究问题

  • RQ1能否构建一个实时系统,从任意未经控制的音频输入生成个性化、逼真的说话头像动画?
  • RQ2如何对音频特征进行适配,以保留如面部纹理与动作风格等个体说话特征?
  • RQ3对头部姿态进行自回归建模,是否能提升音频驱动动画中的时间一致性与个性化程度?
  • RQ4在实时约束下,神经渲染在生成如皱纹与牙齿等真实面部细节方面能达到何种程度?
  • RQ5与当前最先进方法相比,该系统在定性与定量评估中的表现如何?

主要发现

  • 系统在30 fps以上实现实时性能,支持视频会议与虚拟形象等交互式应用。
  • 流形投影模块成功将未经控制的音频适配到目标说话人的语音空间,有效保留了如皱纹与牙齿等个体面部特征。
  • 自回归头部姿态模型提升了动作的时间一致性与个性化程度,减轻了神经渲染中的性能退化。
  • 用户研究表明,LSP在真实感、口型同步准确度与表现力方面均优于当前最先进方法。
  • 定量评估显示,LSP在FID、LPIPS与音视频同步指标上均优于先前方法。
  • 系统对未见过的音频具有良好的泛化能力,包括/p/、/b/与/m/等挑战性音素,尽管在30 fps下短时爆发可能被遗漏。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。