Skip to main content
QUICK REVIEW

[论文解读] Learning Audio-Driven Viseme Dynamics for 3D Face Animation

Linchao Bao, Haoxian Zhang|arXiv (Cornell University)|Jan 15, 2023
Face recognition and analysis被引用 5
一句话总结

本文提出了一种基于音频驱动的3D面部动画系统,通过语音视频中的音素引导追踪和深度音频到音素动作曲线映射网络,学习音素动作动态。该方法生成逼真、便于动画师操作的唇部同步动画,适用于多种角色,并支持多语言输入,对音频失真具有鲁棒性。

ABSTRACT

We present a novel audio-driven facial animation approach that can generate realistic lip-synchronized 3D facial animations from the input audio. Our approach learns viseme dynamics from speech videos, produces animator-friendly viseme curves, and supports multilingual speech inputs. The core of our approach is a novel parametric viseme fitting algorithm that utilizes phoneme priors to extract viseme parameters from speech videos. With the guidance of phonemes, the extracted viseme curves can better correlate with phonemes, thus more controllable and friendly to animators. To support multilingual speech inputs and generalizability to unseen voices, we take advantage of deep audio feature models pretrained on multiple languages to learn the mapping from audio to viseme curves. Our audio-to-curves mapping achieves state-of-the-art performance even when the input audio suffers from distortions of volume, pitch, speed, or noise. Lastly, a viseme scanning approach for acquiring high-fidelity viseme assets is presented for efficient speech animation production. We show that the predicted viseme curves can be applied to different viseme-rigged characters to yield various personalized animations with realistic and natural facial motions. Our approach is artist-friendly and can be easily integrated into typical animation production workflows including blendshape or bone based animation.

研究动机与目标

  • 解决仅从音频生成逼真唇部同步3D面部动画的挑战,特别是在资源有限或非专业制作环境下的应用。
  • 通过将动画建模为音素动作权重曲线而非原始网格顶点,提升可控性与艺术家友好性。
  • 通过鲁棒的音频到音素动作曲线映射模型,实现对未见语音和多语言语音输入的泛化能力。
  • 通过引入音素扫描流程,高效获取真实演员的高保真音素动作资源,支持高效制作工作流。

提出的方法

  • 提出一种新颖的音素引导面部追踪算法,利用音素先验从语音视频中提取音素动作权重曲线,提升与音素的相关性。
  • 训练深度神经网络,将原始音频特征(来自多语言预训练模型)映射为音素动作权重曲线,实现从音频到动画曲线的预测。
  • 采用带残差连接的时序卷积网络(TCN)作为音频到曲线映射模型的主干网络,用于序列建模。
  • 集成基于Transformer的解码器用于消融研究和性能对比,证明其在泛化能力和鲁棒性方面的优越性。
  • 通过形变传递和基于SSDR的骨骼姿态转换,实现音素动作曲线的重定向,支持混合形状与基于骨骼的动画工作流。
  • 开发音素扫描流程,从真实演员中捕获高保真音素动作资源,支持新角色的个性化动画。

实验结果

研究问题

  • RQ1从视频中通过音素引导提取音素动作曲线,能否显著提升音素动作权重与音素之间的相关性,从而增强动画师的控制能力?
  • RQ2所学习的音频到音素动作曲线映射模型在未见说话者和多语言语音输入下的泛化能力如何?
  • RQ3与现有音频驱动面部动画技术相比,该方法在逼真度和自然度方面提升程度如何?
  • RQ4同一组预测的音素动作曲线能否在具有不同面部绑定系统或风格的多个3D角色上有效复用?
  • RQ5该系统对音频失真(如音量变化、音高偏移或背景噪声)的鲁棒性如何?

主要发现

  • 所提出的音素引导音素拟合算法显著提升了音素动作权重与音素之间的相关性,生成的动画曲线更具可预测性与艺术家友好性。
  • 音频到曲线映射模型在唇部同步准确率和自然度方面达到当前最先进水平,即使在音高、音量和语速变化等音频失真条件下依然表现优异。
  • 同一组预测的音素动作曲线可成功应用于多个具有不同音素绑定面部模型的3D角色,生成逼真且个性化的动画。
  • 由于使用了多语言预训练音频特征,系统支持多语言语音输入,能够泛化至未见过的语言和语音。
  • 音素扫描流程可高效获取高保真音素动作资源,显著简化数字人和风格化角色的制作流程。
  • 该方法兼容混合形状与基于骨骼的动画工作流,确保无缝集成至Unity和Unreal Engine等实时引擎的现有动画工作流中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。