[论文解读] End-to-end Learning for 3D Facial Animation from Raw Waveforms of Speech
本文提出了一种端到端的深度学习框架,可直接将原始语音波形映射为3D面部动画参数,包括面部动作单元和头部旋转,而无需依赖手工设计的声学特征。该模型使用CNN+GRU架构,从音频中学习时间动态和情感强度,实现了实时、与说话人无关的动画生成,并在微表情和情感状态方面提升了真实感。
We present a deep learning framework for real-time speech-driven 3D facial animation from just raw waveforms. Our deep neural network directly maps an input sequence of speech audio to a series of micro facial action unit activations and head rotations to drive a 3D blendshape face model. In particular, our deep model is able to learn the latent representations of time-varying contextual information and affective states within the speech. Hence, our model not only activates appropriate facial action units at inference to depict different utterance generating actions, in the form of lip movements, but also, without any assumption, automatically estimates emotional intensity of the speaker and reproduces her ever-changing affective states by adjusting strength of facial unit activations. For example, in a happy speech, the mouth opens wider than normal, while other facial units are relaxed; or in a surprised state, both eyebrows raise higher. Experiments on a diverse audiovisual corpus of different actors across a wide range of emotional states show interesting and promising results of our approach. Being speaker-independent, our generalized model is readily applicable to various tasks in human-machine interaction and animation.
研究动机与目标
- 开发一种仅依赖原始音频波形的实时、与说话人无关的3D面部动画系统。
- 在无显式情感标签的情况下,建模语音中的时变上下文信息和情感状态。
- 消除对MFCC或谱图等工程化声学特征的依赖,这些特征可能丢失与情感相关的细节。
- 通过端到端学习生成平滑、逼真的面部动画,包含微小动作和情感强度。
- 通过从原始音频学习潜在表征,提升语音驱动3D形象的泛化能力与真实感。
提出的方法
- 模型使用卷积神经网络(CNN)从原始音频的傅里叶变换谱图中直接提取有意义的频谱表征。
- 在CNN之后堆叠门控循环单元(GRU)层,以建模时间依赖性并捕捉面部动作的动态变化。
- 网络以端到端方式输出面部动作单元激活值和头部旋转参数,跳过中间的音素或视觉映射表示。
- 3D面部模型通过网络输出生成的混合形状权重进行驱动,实现逼真的表情合成。
- 该框架在RAVDESS数据集上使用原始波形和真实3D面部关键点进行端到端训练。
- 采用基线CNN-static模型进行对比,该模型独立处理每一帧,无循环结构。
实验结果
研究问题
- RQ1深度神经网络能否在无需手工特征的情况下,直接从原始语音波形学习生成逼真的3D面部动画?
- RQ2该模型能否仅从语音中隐式推断并重现情感强度与情感状态?
- RQ3与逐帧处理的基线模型相比,引入循环层(LSTM/GRU)在时间平滑性和准确性方面表现如何?
- RQ4与MFCC等工程化特征相比,使用原始谱图是否能提升模型捕捉细微情感线索的能力?
- RQ5该模型在多样化音视频语料库中,对不同说话人和情感状态的泛化能力如何?
主要发现
- CNN+GRU模型在所有情感类别和测试者中均达到最低的关键点误差(0.7mm RMSE),优于基线模型和CNN+LSTM模型。
- 尽管缺乏循环结构,CNN-static基线模型因泛化能力更强,误差指标最低(比其他模型低30%),但其生成的面部过渡不平滑。
- CNN+GRU模型的泛化能力优于CNN+LSTM,表明GRU更简洁的架构可减少训练数据上的过拟合。
- 该模型成功重现了微表情,如在高兴语音中张大的嘴角和在惊讶时上扬的眉毛,表明其具备隐式情感建模能力。
- 结果表明,虽然CNN能有效从原始音频中学习面部动作表征,但若未仔细正则化,循环层可能导致过拟合。
- 该模型能生成合理的头部旋转,尽管头部姿态估计并非主要目标,其精度低于面部参数估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。