[论文解读] 3D-TalkEmo: Learning to Synthesize 3D Emotional Talking Head
3D-TalkEmo 提出了一种端到端的深度学习框架,用于实现音频驱动的、具有可控情绪状态的3D面部动画。该方法通过多维缩放(multi-dimensional scaling)引入了一种新颖的几何图,以在2D卷积处理中保留3D面部拓扑结构,从而实现在3D网格上的有效非配对情绪迁移,并通过在新创建的大规模3D情感对话头像数据集上进行的广泛用户研究和定量评估,实现了在真实感、内容保真度和情绪表现力方面的最先进性能。
Impressive progress has been made in audio-driven 3D facial animation recently, but synthesizing 3D talking-head with rich emotion is still unsolved. This is due to the lack of 3D generative models and available 3D emotional dataset with synchronized audios. To address this, we introduce 3D-TalkEmo, a deep neural network that generates 3D talking head animation with various emotions. We also create a large 3D dataset with synchronized audios and videos, rich corpus, as well as various emotion states of different persons with the sophisticated 3D face reconstruction methods. In the emotion generation network, we propose a novel 3D face representation structure - geometry map by classical multi-dimensional scaling analysis. It maps the coordinates of vertices on a 3D face to a canonical image plane, while preserving the vertex-to-vertex geodesic distance metric in a least-square sense. This maintains the adjacency relationship of each vertex and holds the effective convolutional structure for the 3D facial surface. Taking a neutral 3D mesh and a speech signal as inputs, the 3D-TalkEmo is able to generate vivid facial animations. Moreover, it provides access to change the emotion state of the animated speaker. We present extensive quantitative and qualitative evaluation of our method, in addition to user studies, demonstrating the generated talking-heads of significantly higher quality compared to previous state-of-the-art methods.
研究动机与目标
- 解决情感对话头像动画中3D生成模型和同步的音视频情绪数据集缺乏的问题。
- 实现在3D面部网格上的非配对情绪迁移,其中输入音频和情绪标签在训练中并非完全配对。
- 开发一种保留局部几何关系的3D人脸表征,以实现高效的2D卷积处理。
- 仅从音频输入和一个中性3D网格生成逼真且富有情绪表现力的3D对话头像。
- 通过在真实感、内容保真度和情绪丰富度方面的定量指标和用户研究验证该方法。
提出的方法
- 该方法通过经典多维缩放(MDS)引入几何图,将3D面部顶点坐标投影到2D标准平面上,同时以最小二乘意义保留顶点之间的测地距离。
- 3D-TalkEmo框架以一个中性3D网格和一个音频序列作为输入,生成具有可控情绪状态的动态3D面部动画序列。
- 情绪迁移通过基于StarGAN的生成器在几何图表征上执行,实现了不同情绪状态之间的非配对学习。
- 在中性对话模型训练过程中应用局部加权策略,以减少重建误差和速度误差,从而提升动画的真实感。
- 引入情绪数据增强策略,以增强判别器区分情绪类别的能力,并防止生成结果的过度平滑化。
- 该框架利用先进的3D人脸重建技术,构建了一个大规模、同步的3D数据集,涵盖多样化的说话人、丰富的音频和多种情绪状态。
实验结果
研究问题
- RQ1深度学习模型能否仅从音频输入生成具有可控情绪表达的逼真3D对话头像?
- RQ2如何将3D面部几何高效地投影到2D表征中,以保留局部邻接关系并支持高效的2D卷积处理?
- RQ3在训练数据中无需精确的音频-情绪对应关系时,能在多大程度上实现在3D面部网格上的非配对情绪迁移?
- RQ4与直接的3D处理方法(如PointNet)相比,所提出的几何图在情绪迁移质量与噪声鲁棒性方面表现如何?
- RQ5数据增强和损失加权策略对生成动画的真实感和情绪多样性有何影响?
主要发现
- 所提出的局部加权策略将重建误差(T-RE)从1.573降低至0.116,速度误差(T-VE)从1.226降低至0.087,显著提升了动画的真实感。
- 情绪增强策略将判别器分类误差(D-CE)从5.36降低至2.09,并提升了生成器对多样化情绪的建模能力,尽管生成器的重建误差略有上升。
- 定性结果表明,基于PointNet的情绪迁移产生了噪声大、失真的输出,而3D-TalkEmo成功以高保真度将情绪从平静状态迁移至快乐状态。
- 23名参与者共345次的用户研究结果证实,3D-TalkEmo在真实感、内容保真度和情绪丰富度方面均优于基线方法,且在所有三个类别中均具有统计显著偏好。
- 几何图保留了顶点邻接关系和局部结构,使得2D卷积神经网络能够有效建模3D表面上的面部动态与情绪转换。
- 该方法在生成情绪丰富且逼真的3D对话头像方面达到了最先进性能,经由定量指标和人工评估双重验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。