Skip to main content
QUICK REVIEW

[论文解读] MeshTalk: 3D Face Animation from Speech using Cross-Modality Disentanglement

Alexander Richard, Michael Zollhoefer|arXiv (Cornell University)|Apr 16, 2021
Face recognition and analysis被引用 4
一句话总结

MeshTalk 提出了一种通用的、由音频驱动的3D人脸动画方法,通过类别潜空间和一种新型跨模态损失,将与音频相关的(例如,嘴唇动作)和与音频无关的(例如,眨眼、眉毛动作)面部运动解耦。该方法在真实感和口型同步准确性方面达到最先进水平,感知研究中75%的参与者更偏好其表现优于SOTA基线方法。

ABSTRACT

This paper presents a generic method for generating full facial 3D animation from speech. Existing approaches to audio-driven facial animation exhibit uncanny or static upper face animation, fail to produce accurate and plausible co-articulation or rely on person-specific models that limit their scalability. To improve upon existing models, we propose a generic audio-driven facial animation approach that achieves highly realistic motion synthesis results for the entire face. At the core of our approach is a categorical latent space for facial animation that disentangles audio-correlated and audio-uncorrelated information based on a novel cross-modality loss. Our approach ensures highly accurate lip motion, while also synthesizing plausible animation of the parts of the face that are uncorrelated to the audio signal, such as eye blinks and eye brow motion. We demonstrate that our approach outperforms several baselines and obtains state-of-the-art quality both qualitatively and quantitatively. A perceptual user study demonstrates that our approach is deemed more realistic than the current state-of-the-art in over 75% of cases. We recommend watching the supplemental video before reading the paper: https://github.com/facebookresearch/meshtalk

研究动机与目标

  • 解决现有音频驱动3D人脸动画方法因对非音频相关面部动态建模不足,导致上半张脸运动呆板或不自然的问题。
  • 通过解耦与音频相关和与音频无关的面部运动分量,克服音频驱动动画中的一对多映射挑战。
  • 实现无需特定人员训练数据或高保真动作捕捉的通用、身份无关的3D人脸动画。
  • 通过独立建模合理且多样的上半张脸运动(例如,眨眼、眉毛上扬)提升感知真实感和协同发音效果。
  • 通过学习解耦且可重用的面部运动潜空间表示,支持实际应用如重定向和网格字幕重制。

提出的方法

  • 引入一种类别潜空间,显式解耦与音频相关的(例如,口型)和与音频无关的(例如,眨眼)面部运动分量。
  • 采用一种新型跨模态损失,以确保在不依赖音频输入的情况下准确重建上半张脸运动,同时仅基于音频实现精确的嘴唇运动。
  • 在学习到的潜空间上采用自回归采样策略,从语音生成时间上连贯且高保真的3D面部动画。
  • 仅使用单个中性3D人脸扫描和音频输入,生成完整面部动画,无需针对身份进行微调。
  • 通过将源身份动画网格的潜码映射到目标身份的中性模板网格,实现重定向和网格字幕重制。
  • 采用配对的音频与3D网格序列进行端到端训练,损失函数促进解耦与模态特异性准确性。

实验结果

研究问题

  • RQ1解耦的潜空间是否能通过解耦与音频相关和与音频无关的面部运动,提升音频驱动3D人脸动画的真实感?
  • RQ2如何设计一种跨模态损失,以确保嘴唇运动准确,同时保留自然且多样的上半张脸运动(如眨眼和眉毛动作)?
  • RQ3通用的、身份无关的模型在真实感和对未见身份的泛化能力方面,能在多大程度上超越特定人员的模型?
  • RQ4解耦的潜表示是否能支持重定向和语言无关的网格字幕重制等实际应用?
  • RQ5在用户研究中,所提出方法是否在感知质量方面优于最先进基线方法?

主要发现

  • 在感知用户研究中,MeshTalk在75%的案例中优于当前SOTA方法(VOCA),其中66.4%的案例被严格偏好,仅42.1%的案例评分低于真实值。
  • 模型实现了高度精确的嘴唇运动,与语音输入精确对齐,经由定量指标和视觉检查验证。
  • 由于与音频输入解耦,眨眼和眉毛上扬等上半张脸运动即使在无音频提示时也自然且合理地多样化。
  • 解耦的潜空间成功实现了从一个身份到另一个身份的面部动画重定向,同时保持了运动质量与身份无关的运动模式。
  • 通过重新合成新语言音频的嘴唇形状并保持原始上半张脸运动,成功演示了网格字幕重制,证明模态解耦支持语言无关的动画生成。
  • 该方法在定性和定量评估中均优于多个基线,确立了音频驱动3D人脸动画的新SOTA水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。