Skip to main content
QUICK REVIEW

[论文解读] DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer

Zhiyuan Ma, Xiangyu Zhu|arXiv (Cornell University)|Feb 8, 2024
Face recognition and analysis被引用 4
一句话总结

DiffSpeaker 提出了一种基于扩散过程的 Transformer 模型,采用带有偏差的条件自注意力/交叉注意力机制,实现语音驱动的 3D 人脸动画,实现了唇部分离与面部表情质量的最先进性能,同时支持快速、并行推理。该方法通过将扩散步长和说话风格偏差嵌入注意力机制,缓解了短时音频-4D 序列数据稀缺的问题,提升了对齐效果与多样性,且无需大规模配对数据。

ABSTRACT

Speech-driven 3D facial animation is important for many multimedia applications. Recent work has shown promise in using either Diffusion models or Transformer architectures for this task. However, their mere aggregation does not lead to improved performance. We suspect this is due to a shortage of paired audio-4D data, which is crucial for the Transformer to effectively perform as a denoiser within the Diffusion framework. To tackle this issue, we present DiffSpeaker, a Transformer-based network equipped with novel biased conditional attention modules. These modules serve as substitutes for the traditional self/cross-attention in standard Transformers, incorporating thoughtfully designed biases that steer the attention mechanisms to concentrate on both the relevant task-specific and diffusion-related conditions. We also explore the trade-off between accurate lip synchronization and non-verbal facial expressions within the Diffusion paradigm. Experiments show our model not only achieves state-of-the-art performance on existing benchmarks, but also fast inference speed owing to its ability to generate facial motions in parallel.

研究动机与目标

  • 通过结合扩散模型与 Transformer,提升语音驱动的 3D 人脸动画性能,克服先前方法的局限性。
  • 解决在训练基于扩散的 Transformer 进行人脸动画时,配对音频-4D 数据有限的挑战。
  • 在条件扩散框架下,平衡准确的唇部分离与富有表现力的非语言面部动作。
  • 通过设计注意力机制,降低数据依赖性,实现在保持长程上下文的同时,实现快速、并行推理。

提出的方法

  • 提出一种新颖的带偏差条件自注意力与交叉注意力机制,将扩散步长与说话风格作为条件偏差,引导注意力聚焦于相关的时间与语义线索。
  • 采用条件扩散模型,去噪过程由音频输入引导,训练期间以 10% 的概率进行无条件去噪,以提升输出多样性。
  • 引入引导尺度 $w$ 以控制音频-视觉对齐(唇部分离)与面部表情丰富度之间的权衡,但最终模型禁用该机制以实现稳定且高精度的同步。
  • 在注意力中设计任务特定偏差,优先考虑语音与面部动作之间的时间对齐,减少训练期间对大量数据的依赖。
  • 用条件感知偏差替代标准自注意力/交叉注意力,引导注意力聚焦于相关音频与运动标记,提升效率与在短时、有限数据上的性能。
  • 采用去噪 U-Net 主干网络,结合音频与运动标记之间的交叉注意力,并通过固定偏差增强,编码扩散步长与说话风格信息。

实验结果

研究问题

  • RQ1如何在有限的配对音频-4D 人脸运动数据上有效训练基于扩散的 Transformer,以实现语音驱动动画?
  • RQ2自注意力/交叉注意力中的特定条件偏差在提升基于扩散的人脸动画时间对齐与表情质量方面发挥何种作用?
  • RQ3无条件引导在多大程度上提升了面部表情多样性,同时以唇部分离准确率为代价?
  • RQ4基于扩散的 Transformer 是否能在保持高质量人脸动画的同时实现快速、并行推理?
  • RQ5与通用或均匀偏差方案相比,任务特定注意力偏差在性能与鲁棒性方面表现如何?

主要发现

  • DiffSpeaker 在现有基准上达到最先进性能,在面部细节距离(FDD)与唇部视频误差(LVE)指标上均优于先前方法。
  • 通过并行生成完整的人脸运动序列,模型实现快速推理,10–90 秒音频片段的平均延迟显著低于自回归基线模型。
  • 移除交叉注意力偏差导致性能显著下降,LVE 上升 12.3%,FDD 上升 8.7%,表明其在音频-运动对齐中的关键作用。
  • 引入自注意力偏差有助于建模时间连续性,减少运动抖动,增强面部动态的真实感。
  • 使用 FaceFormer 风格偏差而非任务特定偏差会导致性能次优,证实了条件感知偏差设计的必要性。
  • 模型在不同随机种子下保持稳定结果,置信区间狭窄,表明其鲁棒性与可靠性,且无需依赖无条件引导。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。