Skip to main content
QUICK REVIEW

[论文解读] Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion

Sen Chen, Zhilei Liu|arXiv (Cornell University)|Apr 27, 2022
Speech and Audio Processing被引用 7
一句话总结

本文提出了一种新颖的说话头生成框架,利用音频和与语音相关的面部动作单元(AUs)作为驱动信号,采用空洞非因果时序卷积自注意力网络(TCSAN)进行多模态特征融合。通过整合音频到AU的预测和AU感知损失,该方法在GRID和TCD-TIMIT数据集上优于最先进方法,显著提升了唇音同步准确度和图像质量。

ABSTRACT

Talking head generation is to synthesize a lip-synchronized talking head video by inputting an arbitrary face image and corresponding audio clips. Existing methods ignore not only the interaction and relationship of cross-modal information, but also the local driving information of the mouth muscles. In this study, we propose a novel generative framework that contains a dilated non-causal temporal convolutional self-attention network as a multimodal fusion module to promote the relationship learning of cross-modal features. In addition, our proposed method uses both audio- and speech-related facial action units (AUs) as driving information. Speech-related AU information can guide mouth movements more accurately. Because speech is highly correlated with speech-related AUs, we propose an audio-to-AU module to predict speech-related AU information. We utilize pre-trained AU classifier to ensure that the generated images contain correct AU information. We verify the effectiveness of the proposed model on the GRID and TCD-TIMIT datasets. An ablation study is also conducted to verify the contribution of each component. The results of quantitative and qualitative experiments demonstrate that our method outperforms existing methods in terms of both image quality and lip-sync accuracy.

研究动机与目标

  • 解决现有说话头生成方法忽略跨模态交互和局部口部肌肉动态的问题。
  • 通过引入与语音相关的面部动作单元(AUs)作为辅助驱动信号,提升唇音同步准确度和视觉质量。
  • 开发一种鲁棒的多模态融合机制,以捕捉长程时间依赖性和跨模态关系。
  • 通过预训练的AU分类器和AU损失,确保生成的面部包含正确的AU模式。
  • 通过跨数据库生成验证模型在不同数据集上的泛化能力。

提出的方法

  • 提出一种空洞非因果时序卷积自注意力网络(TCSAN),用于建模长程时间依赖性并增强跨模态特征交互。
  • 设计了一个音频到AU模块,从音频输入中预测与语音相关的面部动作单元,提供局部口部运动引导。
  • 采用预训练的AU分类器,通过AU损失组件在生成帧中强制实现逼真的AU模式。
  • 结合多种损失函数:重建损失、感知损失、身份损失和AU损失,以提升图像保真度和同步性。
  • 采用非因果TCN架构,利用过去和未来的上下文信息,实现比因果RNN或TCN更优的时间建模。
  • 通过TCSAN模块融合音频和AU特征,实现联合表征学习,捕捉模态间关系。

实验结果

研究问题

  • RQ1将与语音相关的面部动作单元(AUs)作为驱动信号,是否能提升说话头生成中的唇音同步准确度?
  • RQ2空洞非因果时序卷积自注意力网络(TCSAN)在建模音频与面部运动之间跨模态关系方面效果如何?
  • RQ3与仅使用音频驱动相比,音频到AU模块是否能提升口部运动的真实感与精确度?
  • RQ4所提出的多模态融合机制在图像质量和时间连贯性方面相较于基线方法改善程度如何?
  • RQ5该模型是否具备跨数据集泛化能力,例如从GRID训练模型在TCD-TIMIT数据集上生成高质量说话头?

主要发现

  • 所提模型在GRID和TCD-TIMIT数据集上均达到最先进性能,图像质量与唇音同步准确度均表现最优。
  • 消融实验证实,各组件(尤其是TCSAN模块和AU损失)显著提升了生成质量与同步性。
  • 音频到AU模块能有效从音频中预测与语音相关的AUs,从而实现更准确、自然的口部运动。
  • 即使在无声音频输入下,模型仍保持高视觉保真度,表现出强鲁棒性并有效抑制了虚假的唇部运动。
  • 从GRID训练模型跨数据库生成至TCD-TIMIT数据集,展现出强大泛化能力,口部运动一致且准确匹配输入音频。
  • 定性结果表明,完整模型在面部纹理、牙齿清晰度和唇音同步方面均优于基线,图11中红色框标注示例显示同步误差减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。