[论文解读] SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation
SadTalker 提出了一种新颖的音频驱动说话人脸动画系统,通过从语音音频中生成逼真的 3D 运动系数(头部姿态、表情)并利用它们隐式调制一个 3D 感知的人脸渲染器,实现高保真度的视频合成。通过使用 ExpNet 和 PoseVAE 解耦表情与姿态建模,并结合一种新颖的 3D 感知渲染器及无监督 3D 关键点映射,该方法在运动真实感、同步性和视觉质量方面达到了最先进性能。
Generating talking head videos through a face image and a piece of speech audio still contains many challenges. ie, unnatural head movement, distorted expression, and identity modification. We argue that these issues are mainly because of learning from the coupled 2D motion fields. On the other hand, explicitly using 3D information also suffers problems of stiff expression and incoherent video. We present SadTalker, which generates 3D motion coefficients (head pose, expression) of the 3DMM from audio and implicitly modulates a novel 3D-aware face render for talking head generation. To learn the realistic motion coefficients, we explicitly model the connections between audio and different types of motion coefficients individually. Precisely, we present ExpNet to learn the accurate facial expression from audio by distilling both coefficients and 3D-rendered faces. As for the head pose, we design PoseVAE via a conditional VAE to synthesize head motion in different styles. Finally, the generated 3D motion coefficients are mapped to the unsupervised 3D keypoints space of the proposed face render, and synthesize the final video. We conducted extensive experiments to demonstrate the superiority of our method in terms of motion and video quality.
研究动机与目标
- 解决现有音频驱动说话人脸方法存在的不自然头部运动、表情失真和身份漂移等问题。
- 通过将 3D 面部运动系数(头部姿态、表情)建模为解耦的、音频驱动的表征,提升运动真实感和视频质量。
- 开发一种无需显式 3D 监督即可将 3DMM 系数映射为逼真视频的 3D 感知人脸渲染器。
- 实现从单张参考图像和语音音频生成风格多样、富于变化且同步的说话人脸。
提出的方法
- 引入 ExpNet,通过从仅唇部运动系数蒸馏并结合 3D 渲染人脸上的感知损失(唇读和基于关键点的损失),从音频中学习面部表情系数。
- PoseVAE 是一种条件变分自编码器,通过学习基于输入音频的残差姿态变化,实现多样化且风格化的头部姿态运动建模。
- 提出一种新颖的 3D 感知人脸渲染器,将 3DMM 运动系数映射至无监督的 3D 关键点空间,实现身份保持的源图像形变。
- 系统采用两阶段训练流程:首先独立训练表情和姿态分支,然后通过端到端推理联合微调人脸渲染器。
- 人脸渲染器采用映射网络,利用稀疏的无监督 3D 关键点监督,将 3DMM 系数转换为 2D 形变场。
- 框架通过对抗损失、身份重建损失以及音视频同步损失进行训练,以确保生成结果的真实感与对齐性。
实验结果
研究问题
- RQ1能否通过从音频中学习解耦的 3D 运动系数(表情与姿态)表征来提升说话人脸动画的真实感并减少失真?
- RQ2如何使 3D 感知人脸渲染器在无显式 3D 监督下有效生成高质量视频?
- RQ3通过条件变分自编码器建模姿态多样性在多大程度上提升了头部运动的自然感与风格化程度?
- RQ4与以往基于 2D 光流或关键点的方法相比,所提方法是否能在运动同步性和视觉质量方面实现更优性能?
- RQ5解耦的 3D 系数学习在多大程度上缓解了身份改变与表情失真问题?
主要发现
- 在混合风格设置下,所提方法的多样性得分为 0.2778,对齐得分(beat alignment)为 0.293,优于单一固定风格基线(多样性 0.2735,对齐得分 0.287)。
- 消融实验表明,若移除 GAN 损失,多样性降至 0.2500,对齐得分降至 0.271,表明其在提升真实感方面具有关键作用。
- 若移除初始姿态条件,多样性降至 0.2725,对齐得分降至 0.278,证实其对运动一致性的关键影响。
- 人脸渲染器的消融实验表明,其在表情重建方面优于 PIRenderer,且显著减少了不自然的面部对齐伪影。
- 该方法在运动同步性和视频质量方面优于先前的 SOTA 方法,尤其在减少失真与身份漂移方面表现突出。
- 局限性包括由于 3DMM 无法建模牙齿变化而偶尔出现的牙齿伪影,可通过 GFPGAN 等后处理恢复网络缓解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。