[论文解读] FaceFormer: Speech-Driven 3D Facial Animation with Transformers
FaceFormer 提出了一种基于 Transformer 的自回归模型,用于语音驱动的 3D 面部动画,通过利用长期音频上下文和自监督语音表征,生成具有准确唇部同步的逼真、时间上连贯的 3D 面部网格。该方法引入了有偏的交叉注意力机制和周期性位置编码策略,在感知研究和对更长音频序列的泛化能力方面优于当前最先进方法。
Speech-driven 3D facial animation is challenging due to the complex geometry of human faces and the limited availability of 3D audio-visual data. Prior works typically focus on learning phoneme-level features of short audio windows with limited context, occasionally resulting in inaccurate lip movements. To tackle this limitation, we propose a Transformer-based autoregressive model, FaceFormer, which encodes the long-term audio context and autoregressively predicts a sequence of animated 3D face meshes. To cope with the data scarcity issue, we integrate the self-supervised pre-trained speech representations. Also, we devise two biased attention mechanisms well suited to this specific task, including the biased cross-modal multi-head (MH) attention and the biased causal MH self-attention with a periodic positional encoding strategy. The former effectively aligns the audio-motion modalities, whereas the latter offers abilities to generalize to longer audio sequences. Extensive experiments and a perceptual user study show that our approach outperforms the existing state-of-the-arts. The code will be made available.
研究动机与目标
- 为解决从语音生成逼真、时间稳定的 3D 面部动画的挑战,特别是针对长音频序列。
- 通过利用自监督预训练语音表征(如 wav2vec 2.0)来克服 3D 音视频数据集中的数据稀缺问题。
- 通过建模长距离音频上下文和运动历史,提升唇部同步和面部表情的逼真度。
- 通过在交叉注意力中引入新颖的对齐偏置,增强语音与面部运动之间的模态对齐。
- 通过周期性位置编码策略,实现对超过训练长度的更长音频序列的泛化能力。
提出的方法
- 模型使用 Transformer 编码器,处理原始音频并利用自监督的 wav2vec 2.0 表征,以捕捉长距离音频上下文。
- 自回归解码器逐帧预测 3D 面部网格,利用因果自注意力机制建模运动历史,以保证时间稳定性。
- 引入一种有偏的跨模态多头注意力机制,通过在查询-键评分中注入对齐偏置,实现音频与运动模态的对齐。
- 在解码器的自注意力中应用周期性位置编码(PPE)策略,结合时间偏置与正弦嵌入,以提升对更长序列的泛化能力。
- 模型在 3D 面部运动序列上端到端训练,以原始音频为条件,输出为 3D 网格顶点序列。
- 该架构避免使用基于 RNN 的循环机制,完全依赖自注意力来建模长距离依赖性和局部动态特性。
实验结果
研究问题
- RQ1基于 Transformer 的架构能否有效建模长期音频上下文,以实现具有准确唇部同步的逼真 3D 面部动画?
- RQ2在 3D 面部动画的低数据场景下,自监督语音表征如何提升性能?
- RQ3在语音与面部运动之间的交叉注意力中,模态对齐起什么作用?如何通过偏置机制加以增强?
- RQ4经过修改的位置编码策略能否提升对训练时未见的更长音频序列的泛化能力?
- RQ5与基于循环的模型相比,使用自注意力的自回归预测在运动连贯性和唇部同步准确性方面表现如何?
主要发现
- 在感知用户研究中,FaceFormer 的表现优于当前最先进方法,57.78% 的参与者认为其面部动画比基线模型更逼真。
- 该模型在唇部同步方面表现显著更优,62.22% 的用户认为其唇部运动与音频更同步,优于使用原始正弦位置编码的基线模型。
- 若移除交叉注意力中的对齐偏置,面部表情会变得沉闷、不自然,证实该偏置对模态对齐的必要性。
- 周期性位置编码(TB+PPE)策略显著提升了对更长音频序列的泛化能力,减少了使用 ALiBi 或标准正弦编码时常见的时间抖动和静态冻结问题。
- 采用自注意力的自回归解码器生成的唇部运动比全连接解码器或基于 LSTM 的替代方案更具时间连贯性和稳定性。
- 在 AMT 基准测试中,使用 20 秒音频片段(超过平均训练长度四倍)时,FaceFormer 仍能保持高质量动画,而使用标准位置编码的模型在静音帧期间表现出不稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。