[论文解读] Write-a-speaker: Text-based Emotional and Rhythmic Talking-head Generation
本文提出了一种基于文本的说话人头部视频生成框架,能够从时间对齐的文本输入中合成逼真、富有情感且节奏同步的面部动画与头部运动。通过采用两阶段架构——首先进行与说话人无关的面部和头部运动建模,随后利用3D面部引导注意力网络进行说话人特定的适应——该方法仅需每位说话人5分钟的参考视频即可实现最先进性能。
In this paper, we propose a novel text-based talking-head video generation framework that synthesizes high-fidelity facial expressions and head motions in accordance with contextual sentiments as well as speech rhythm and pauses. To be specific, our framework consists of a speaker-independent stage and a speaker-specific stage. In the speaker-independent stage, we design three parallel networks to generate animation parameters of the mouth, upper face, and head from texts, separately. In the speaker-specific stage, we present a 3D face model guided attention network to synthesize videos tailored for different individuals. It takes the animation parameters as input and exploits an attention mask to manipulate facial expression changes for the input individuals. Furthermore, to better establish authentic correspondences between visual motions (i.e., facial expression changes and head movements) and audios, we leverage a high-accuracy motion capture dataset instead of relying on long videos of specific individuals. After attaining the visual and audio correspondences, we can effectively train our network in an end-to-end fashion. Extensive experiments on qualitative and quantitative results demonstrate that our algorithm achieves high-quality photo-realistic talking-head videos including various facial expressions and head motions according to speech rhythms and outperforms the state-of-the-art.
研究动机与目标
- 从文本输入生成高保真、富有情感且节奏准确的说话人头部视频,克服依赖音频方法的局限性。
- 通过使用时间对齐的文本而非声学特征,解决说话人泛化中的音色差异问题。
- 将新说话人所需参考视频长度从超过一小时减少至仅5分钟。
- 协调语音节奏与情感,建模整体面部表情(嘴部、上半张脸、头部)的同步运动。
- 利用高精度动作捕捉数据建立真实的视听对应关系,而非依赖长时视频数据。
提出的方法
- 在说话人无关阶段使用三个并行网络,从时间对齐的文本中生成嘴部、上半张脸和头部姿态的动画参数。
- 在说话人特定阶段采用3D面部模型引导的注意力网络,将通用动画参数适配至目标说话人的身份特征。
- 利用高精度动作捕捉数据,建立语音节奏、情感与视觉运动之间的精确对应关系。
- 应用3D形态模型(3DMM)拟合过程,通过能量最小化函数从关键帧地标估计姿态与表情参数。
- 采用对抗损失、重建损失以及面部关键点与表情一致性正则化项,端到端训练网络。
- 在渲染网络中使用共享残差块的词、音素和情感嵌入(V^txt, V^ph, V^emo),用于面部与掩码生成。
实验结果
研究问题
- RQ1基于文本的框架是否能够在不依赖说话人特定音频的情况下,生成富有情感且节奏准确的说话人头部视频?
- RQ2如何仅从时间对齐的文本输入有效建模整体面部与头部运动?
- RQ3与先前方法所需超过一小时的参考视频相比,5分钟的参考视频在多大程度上足以实现高保真度的说话人特定视频生成?
- RQ4与使用长视频记录相比,动作捕捉数据是否能提升视觉动画的质量与对齐精度?
- RQ5所提出的3D面部引导注意力机制在多大程度上提升了生成视频中的身份保留与表情真实感?
主要发现
- 所提方法生成了具有丰富面部表情和节奏性头部运动的逼真说话人头部视频,且与语音节奏和情感高度对齐。
- 该框架在定性和定量评估中均优于最先进方法,展现出更优的视觉保真度与时间一致性。
- 说话人特定阶段仅使用5分钟参考视频即实现高质量结果,与先前工作相比显著降低了数据需求。
- 使用时间对齐的文本输入有效缓解了音色差异问题,实现了在不同说话人及合成语音输入下的稳健性能。
- 基于动作捕捉数据的训练数据使视听对应关系学习更加精确,从而生成更自然、更同步的动画。
- 该方法是首个仅基于时间对齐的文本表示,即可生成包含情感面部表情与节奏性头部运动的完整说话人头部视频的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。