[论文解读] Audio2Face: Generating Speech/Face Animation from Single Audio with Attention-Based Bidirectional LSTM Networks
本文提出 Audio2Face,一种端到端深度学习框架,仅通过单音频输入即可直接生成逼真的3D面部动画(包括唇部动作和自发性表情),采用基于注意力机制的双向LSTM网络。该模型在低延迟下实现最先进性能,通过学习梅尔频率倒谱系数(MFCCs)的时序依赖关系和注意力加权的声学特征,实现实时动画生成。
We propose an end to end deep learning approach for generating real-time facial animation from just audio. Specifically, our deep architecture employs deep bidirectional long short-term memory network and attention mechanism to discover the latent representations of time-varying contextual information within the speech and recognize the significance of different information contributed to certain face status. Therefore, our model is able to drive different levels of facial movements at inference and automatically keep up with the corresponding pitch and latent speaking style in the input audio, with no assumption or further human intervention. Evaluation results show that our method could not only generate accurate lip movements from audio, but also successfully regress the speaker's time-varying facial movements.
研究动机与目标
- 开发一种实时、端到端的系统,仅从音频输入生成高保真面部动画,无需视频、图像或人工干预。
- 解决将复杂、时变的面部动作映射到语音输入的挑战,涉及长程依赖关系和非线性映射。
- 通过学习与情感状态和发音状态相关的语音潜在表征,同时建模唇部动作和自发性面部表情。
- 通过训练后对新3D面部几何体的重定向能力,确保在不同面部模型间的泛化能力。
- 通过优化推理速度以满足严格实时性要求,适用于交互式应用的部署。
提出的方法
- 输入为原始音频转换为手工提取的梅尔频率倒谱系数(MFCCs),作为主要声学特征。
- 双向LSTM网络处理序列化的MFCCs,以捕捉前后两个方向的长程时序依赖关系和上下文信息。
- 在LSTM层中集成注意力机制,以在每个时间步动态加权不同声学特征的重要性,提升语音与面部动作之间的对齐精度。
- 输出为3D可变形面部模型的混合形状参数序列,驱动逼真的面部形变,包括唇形和自发性表情。
- 整个框架通过预测值与真实值之间混合形状参数的均方误差(MSE)损失进行端到端训练。
- 推理过程经过优化,实现低延迟,每音频窗口平均处理时间为0.68ms(帧率33.3ms),支持实时动画生成。
实验结果
研究问题
- RQ1深度学习模型能否仅从音频输入生成准确且自然的面部动画,而无需任何视觉或辅助输入?
- RQ2基于注意力机制的双向LSTM在学习不同说话风格和音高下的语音特征与面部动作之间复杂非线性映射方面,效果如何?
- RQ3与标准RNN或HMM相比,注意力机制在提升时间对齐精度和面部细节生成方面有多大改进?
- RQ4训练好的模型是否可通过重定向泛化到新的3D面部模型,同时保持面部表情保真度?
- RQ5该模型的推理延迟是多少?是否能够支持虚拟助手或视频会议等实时应用?
主要发现
- 与HMM和标准LSTM基线相比,所提方法在所有测试集上均取得最低RMSE,均值指标下RMSE为0.2883(512个神经元),表明在预测混合形状参数方面具有更高精度。
- 512个神经元的模型在面部动画任务中优于更小的网络架构,表明复杂、全脸运动生成需要更高容量模型。
- 模型在新面部模型上表现出良好泛化能力,通过成功将模型重定向至另一卡通角色,同时保持面部动作一致性。
- 推理平均耗时为每音频窗口0.68ms(帧率33.3ms),证实其具备实时性能,适用于交互式应用。
- 模型成功回归了唇部动作和自发性面部表情,但因眨眼模式与语音无显著关联,未能准确预测眨眼行为。
- 定性结果表明,生成的面部动画自然可信,与真实数据高度一致,尤其在唇部同步和动态面部表情方面表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。